EvalStone Results
多模型同基准对比 · 扫描
output/
启动台
结果分析
数据源
Output Dir
重新扫描
选择模型(folder)
全选
清空
选择 Benchmark
全选
清空
更新对比
能力分类走势
横轴 = 能力域(数学/代码/智能体等),纵轴 = 该域平均分
能力分类柱状对比
各模型在同一能力域的平均得分
得分走势
横轴 = benchmark,纵轴 = score
柱状对比
同 benchmark 下各模型得分
雷达图
能力轮廓(需 ≥3 个共同 benchmark)
得分表
平均值(跨 seed / multi-run)
各 Benchmark 排名