• Joined on 2026-07-22
sora pushed to main at Meta-Eval/EvalHarness 2026-09-17 09:21:17 +00:00
15b1574857 tau2: module-level silencing (order-independent)
sora pushed to main at Meta-Eval/EvalHarness 2026-09-17 09:19:03 +00:00
a69cea2b76 tau2: ERROR+ log level; TAU2_DATA_DIR kills the data-dir banners
sora pushed to main at Meta-Eval/EvalHarness 2026-09-17 09:15:00 +00:00
30af23212e tau2: silence loguru BEFORE the first tau2 import
sora pushed to main at Meta-Eval/EvalHarness 2026-09-17 09:12:19 +00:00
e015b5035f max_turns: config-driven (default 200), runner default 8 -> 200
sora pushed to main at Meta-Eval/EvalHarness 2026-09-17 09:10:33 +00:00
b62088997d tau2: floor max_turns at 40 (runner's generic 8 starved every sim)
sora pushed to main at Meta-Eval/EvalHarness 2026-09-17 09:07:56 +00:00
fa60065099 tau2: silence per-message DEBUG floods; is_final_chunk only when done
sora pushed to main at Meta-Eval/EvalHarness 2026-09-17 09:03:53 +00:00
d244d1a435 tau2 bridge: strip </think> leakage from simulator output
sora pushed to main at Meta-Eval/EvalHarness 2026-09-17 08:56:50 +00:00
bcb2128b02 tau2 env: auto-install the engine (local checkout -> GitHub), manual fallback
sora pushed to main at Meta-Eval/EvalHarness 2026-09-17 08:55:07 +00:00
97a458d9b8 README: agent-env extra dependencies (tau2-bench engine, swebench)
8519e9ae18 Primary metric skips extraction_failure_rate (diagnostics)
081249d47c swe: repo-base image naming (correct indentation this time)
5c14d11852 env per-bench from YAML config; swe image naming to official repo-base
b3c10d23f2 judge spec: url+model always combines (path-shaped model ids)
Compare 27 commits »
sora pushed to main at Meta-Eval/EvalHarness 2026-09-17 02:10:53 +00:00
e9b79a2a41 thinking.yaml: 64k budgets for the full-thinking ladder (es parity)
b1c88bef25 --thinking: unified switch (off/low/medium/high/max/full)
80194e845e --reasoning-effort: control thinking intensity (verified honored)
5e98f6b701 ensure_image pulls through the CN mirror chain
2949e10371 bigcodebench: official image + fail-fast preflight + no-retry on missing image
Compare 33 commits »
sora pushed to main at Meta-Eval/EvalHarness 2026-09-14 05:43:53 +00:00
9a64896c97 repeats: persist every per-run score, not just the last report
sora pushed to main at Meta-Eval/EvalHarness 2026-09-14 04:05:20 +00:00
9049bd683d openai-pool: allow plain-URL members (no port range required)
sora pushed to main at Meta-Eval/EvalHarness 2026-09-14 04:01:46 +00:00
6ad68bdfc0 --auto-concurrency: let the adaptive gate drive request concurrency
sora pushed to main at Meta-Eval/EvalHarness 2026-09-14 03:51:27 +00:00
e1a96f18c0 Scoring phase retargets the same progress bar
sora pushed to main at Meta-Eval/EvalHarness 2026-09-14 03:48:02 +00:00
25e51c5b30 Scoring milestones: only when no live bar
sora pushed to main at Meta-Eval/EvalHarness 2026-09-14 03:34:14 +00:00
841b7b1ffb Bound the sandbox rm -f cleanup calls (60s)
sora pushed to main at Meta-Eval/EvalHarness 2026-09-14 03:26:37 +00:00
92b36c5e6c Sandbox: reap timed-out containers, retry daemon-side failures; scoring milestones
sora pushed to main at Meta-Eval/EvalHarness 2026-09-14 03:14:12 +00:00
a4d4592864 Scoring-phase progress; pool: fix double-release + cross-loop reuse
sora pushed to main at Meta-Eval/EvalHarness 2026-09-14 03:05:20 +00:00
f5c2e4c5af Progress bar: fresh-this-run counter; fix KeyError 'success'
sora pushed to main at Meta-Eval/EvalHarness 2026-09-14 02:45:23 +00:00
20d2d5537a Run plan: show real sample/generation counts from local cache