Logo
Explore Help
Register Sign In
Meta-Eval/EvalHarness
3
0
Fork 0
You've already forked EvalHarness
Code Issues Pull Requests Actions Packages Projects Releases Wiki Activity
EvalHarness/evalharness/agent
History
sora b62088997d tau2: floor max_turns at 40 (runner's generic 8 starved every sim)
Both reward-0 runs died with 'Termination reason: max_steps' after 3-4
exchanges -- the runner passes its generic default (8) down, far too
few for greet->verify->find->policy->act->confirm. Official tau2 runs
use 40+; floor, don't cap.

Co-Authored-By: Claude <noreply@anthropic.com>
2026-09-17 09:10:32 +00:00
..
envs
tau2: floor max_turns at 40 (runner's generic 8 starved every sim)
2026-09-17 09:10:32 +00:00
__init__.py
Comparison-driven fixes: MCQ choices in prompt + letter contract, Answer: suffix for QA, markdown answer cleaning, trivia_qa answer_phrase priority, DROP gold-as-alternatives (OR) official semantics, retry on 5xx, numpy/scipy compat
2026-08-24 15:48:42 +00:00
loop.py
tau2 via OFFICIAL engine: self-running env plugin (run_task hook + needs_adapter generic dispatch, no name hardcoding), deep generate() patch, official ToolCall shape, data plugin keeps verbatim Task json, official reward scoring; checkpoint plugin (per-sample resume) + summary csv with time/categories
2026-08-25 11:06:08 +00:00
Powered by Gitea Version: 1.23.5 Page: 62ms Template: 6ms
English
Bahasa Indonesia Deutsch English Español Français Gaeilge Italiano Latviešu Magyar nyelv Nederlands Polski Português de Portugal Português do Brasil Suomi Svenska Türkçe Čeština Ελληνικά Български Русский Українська فارسی മലയാളം 日本語 简体中文 繁體中文(台灣) 繁體中文(香港) 한국어
Licenses API