Evals

See also eval/tasks/readme.md and spec/eval.md in the Zox repo.

Commands (README)

CommandPurpose
zox eval runFixture evals (default: mock tasks)
zox eval privateHidden-grader private suite
zox eval swe-liteSWE-bench Lite subset (Docker)
zox eval terminal-benchTerminal-Bench 2.0 (Docker)
zox eval archiveArchive last eval artifacts

Fixture suite

YAML tasks with expect.stdoutIncludes and/or expect.files.

sh
zox eval run                          # eval/tasks/mock + mock/echo
zox eval run eval/tasks/live --model openai/gpt-4.1

--max-turns (live default 50), --timeout-ms (default 300000), --sandbox.

Private suite

eval/private/<id>/: README.md prompt, repo/ start tree, hidden tests/ + grader.sh. Agent never sees hidden tests. Default k=3.

sh
zox eval private --model openai/gpt-4.1 --k 1

Artifacts: eval/results/private/<task>/trial-N/.

SWE-bench Lite

Needs Docker and swebench in a venv. Real --model (not mock/*).

sh
zox eval swe-lite --model openai/gpt-4.1 --limit 1
zox eval swe-lite --model openai/gpt-4.1 --skip-eval

Terminal-Bench 2.0

Docker + Harbor. Adapter: eval/adapters/harbor/zox_agent.py.

sh
zox eval terminal-bench --model openai/gpt-4.1 --limit 1

Archive

sh
zox eval archive

Eval-only flags (--limit, --k / --n-attempts, --skip-eval, --instance-id, --task, --jobs-dir) are listed in CLI reference.