• Joined on 2026-07-22
sora pushed to main at Meta-Eval/EvalHarness 2026-08-25 11:06:10 +00:00
78459c974e tau2 via OFFICIAL engine: self-running env plugin (run_task hook + needs_adapter generic dispatch, no name hardcoding), deep generate() patch, official ToolCall shape, data plugin keeps verbatim Task json, official reward scoring; checkpoint plugin (per-sample resume) + summary csv with time/categories
sora pushed to main at Meta-Eval/EvalHarness 2026-08-25 10:48:22 +00:00
85dd193bcf Execution-bench fixes verified on real model: BCB standalone-module + unittest semantics (100%), LCB base64+zlib+pickle private cases + line-normalized runner (100%), code_any def-start heuristic, general_fc should-call-tool semantics (80%), bfcl real-model 51 samples/17 categories (45.1%, multi_turn needs stateful env - known)
sora pushed to main at Meta-Eval/EvalHarness 2026-08-25 05:18:24 +00:00
1da665fec4 Add --limit-per-task (per-subset cap, evalscope --limit semantics; composable with --limit as intersection); execution-bench parity verified: official human-eval core 5/5 == our docker sandbox on same completions
sora pushed to main at Meta-Eval/EvalHarness 2026-08-25 02:51:58 +00:00
89e721414f Simplify install: light deps (datasets/pyarrow/sympy/pylatexenc/numpy/scipy) are DEFAULT; single [bfcl] extra for the heavy official checker
sora pushed to main at Meta-Eval/EvalHarness 2026-08-25 02:49:10 +00:00
99c9df5412 Unify on-demand install hints to extras names ([all]/[bfcl]); native bfcl fallback carries upgrade hint
sora pushed to main at Meta-Eval/EvalHarness 2026-08-25 02:47:29 +00:00
32b7276142 Extras: add [all] (conflict-free bundle) and [bfcl] (official checker, heavy deps isolated)
sora pushed to main at Meta-Eval/EvalHarness 2026-08-25 02:26:29 +00:00
d830e08923 Drop logprob scoring path entirely; MCQ = strict-letter generation (evalscope parity 'ANSWER: X'), few-shot defaults stay; fix output.py duplication
sora pushed to main at Meta-Eval/EvalHarness 2026-08-25 02:22:00 +00:00
a8d3400ed5 Paper-faithful eval: P1 logprob scoring (completions_echo + chat_first_token fallback, sglang top_logprobs parser), few_shot_num dataset defaults (mmlu5/cmmlu5/mmlu_pro5/gsm8k4/math4/drop3), official BBH 3-shot CoT vendored, strict_letter default prompt (evalscope parity), official simpleqa grader prompt
sora pushed to main at Meta-Eval/EvalHarness 2026-08-24 15:48:44 +00:00
a32d902e94 Comparison-driven fixes: MCQ choices in prompt + letter contract, Answer: suffix for QA, markdown answer cleaning, trivia_qa answer_phrase priority, DROP gold-as-alternatives (OR) official semantics, retry on 5xx, numpy/scipy compat
sora pushed to main at Meta-Eval/EvalHarness 2026-08-24 08:43:50 +00:00
3d16ab9103 Add SWE-bench single-turn harness (patch apply + FAIL_TO_PASS in official sweb image, sh entries in docker sandbox), bigcodebench official all-libs image, docker default for humaneval/LCB, input truncation (max_input_chars) + context assembly (passage/context), API retry with backoff, judge thread-safe bridge, parquet blob integrity check, summary.csv in out-dir, sandbox prefetch CLI
sora pushed to main at Meta-Eval/EvalHarness 2026-08-24 07:11:05 +00:00
b2e7133b20 Add sandbox layer (docker exec hard-isolation + serve envs, refcounted acquire/release, atexit teardown, bind-mount sharing) and agent evaluation driver (message pump drive(), Trajectory, bfcl_mock env with official call-sequence scoring, mock:fc oracle); Deployer delegates to sandbox.serve_env; code_any extractor fixes indentation-stripping; CLI --env
sora pushed to main at Meta-Eval/EvalHarness 2026-08-24 06:28:02 +00:00
6b3bb330c7 Add model layer: async ModelAdapter (openai_compatible + mock) returning structured ModelOutput(text,tool_calls,usage), Deployer registry (vllm/sglang docker-pinned via models.yaml, external), async run_eval generate->score, CLI --model, agent-ready SampleResult.trajectory/env_state, tests
sora pushed to main at Meta-Eval/EvalHarness 2026-08-24 06:09:40 +00:00
4a15f80897 Add evaluation layer + visualization: extract/score/aggregate plugins, 28 recipes, official-aligned scorers (PRM800K math, DROP Hungarian EM/F1, SimpleQA A/B/C judge), report artifacts, console renderers, CLI eval/viz, regression tests
sora pushed to main at Meta-Eval/EvalHarness 2026-08-24 03:37:17 +00:00
414a89216c Unify cache root override: loader.get/set_cache_root as single source, fixes --cache-dir not relocating .raw blobs
sora created branch main in Meta-Eval/EvalHarness 2026-08-24 03:35:18 +00:00
sora pushed to main at Meta-Eval/EvalHarness 2026-08-24 03:35:18 +00:00
f8cd15fea1 EvalHarness data layer: 28 dataset plugins, lazy materialize cache (raw/ + samples.jsonl + meta.json), ModelScope native loader, CLI list/fetch/unload/stats/show
sora created repository Meta-Eval/EvalHarness 2026-08-24 03:30:20 +00:00
sora pushed to main at sora/evalstone 2026-08-18 05:48:49 +00:00
897f8fb1b9 document benchmark and environment matrix
sora pushed to main at sora/evalstone 2026-08-18 03:33:07 +00:00
ff946f221a add beginner docker evaluation SOP
sora pushed to main at sora/evalstone 2026-08-18 03:21:20 +00:00
4d54a8c7ea update benchmark suites and evaluation docs