3d16e9647aTool-call parsing: Qwen3 native <tool_call> XML fallback in _parse (parser-agnostic, zero overhead when server converts properly)sora2026-08-26 06:29:49 +00:00
7114564301Multi-endpoint model pool (openai-pool/{lo..hi} round-robin with failover), nothink/textools spec flags (chat_template_kwargs enable_thinking=false; text-protocol tool calls for backends without --enable-auto-tool-choice), global cross-bench queue in ladder runssora2026-08-26 06:26:52 +00:00
f3514d7c08Fix checkpoint cross-contamination (scope by dataset name from run_eval, not inferred); ladder20 comparison artifactssora2026-08-26 02:24:00 +00:00
78459c974etau2 via OFFICIAL engine: self-running env plugin (run_task hook + needs_adapter generic dispatch, no name hardcoding), deep generate() patch, official ToolCall shape, data plugin keeps verbatim Task json, official reward scoring; checkpoint plugin (per-sample resume) + summary csv with time/categoriessora2026-08-25 11:06:08 +00:00
1da665fec4Add --limit-per-task (per-subset cap, evalscope --limit semantics; composable with --limit as intersection); execution-bench parity verified: official human-eval core 5/5 == our docker sandbox on same completionssora2026-08-25 05:18:23 +00:00
89e721414fSimplify install: light deps (datasets/pyarrow/sympy/pylatexenc/numpy/scipy) are DEFAULT; single [bfcl] extra for the heavy official checkersora2026-08-25 02:51:55 +00:00