大模型排行榜,快排不明白了

不改变模型权重的Skill可以使DeepSeekekill。 V4 Pro“秒杀”海外顶级模型Claude Fable 5?

J-Space的第三方Skill项目配套报告显示,V4-Pro-在0813接入这个Skill之后,7个智能体和编程评估都超过了Fable。 5参考成绩。

随后,另一组开发者进行了A/B测试,但他们没有看到任务完成率的提高。相反,他们花了更多的时间访问J-Space组。

谁是对的?现在还不能下结论。两边使用的模型和任务不一样,考试也不一样。

但是这个争议暴露了排行榜上的一个漏洞:今天写在模型名下的成绩,越来越多的是模型,Harness、共同产生的前后文、工具再试策略。

排行榜还在给模型排座位,真正参加比赛的已经是一套完整的执行系统。

只公布模型名称和最终结果的大模型排名,在智能体和编程任务中失去了解释力。

首先,更换一套Harness,同一模型可以更改排名。

首先看看J-Space的“秒杀”是怎样得到的。

项目报告显示,V4-Pro-0813接入J-Space后,Terminal Bench 87.9分从2.1升至90.1分,Fable 5分为88.0分,DeepSWE从62.7分上升到72.0分,Fable 5为70.0分;Toolathlon-Verified从74.1分上升到79.5分,Fable 5为77.9分。

DeepSeek在报告中列出的7个比较中都取得了更高的成绩。然而,这并非在相同条件下进行的正面对比:DeepSeek的分数由J-Space项目方测量,Fable 5的分数来自制造商的公开信息。双方使用的Harness、资源预算与运行设置不统一。

八月十七日,另一组开发人员进行了不同的测试。它们没有使用V4-Pro-0813,也没有重跑以上7项评估,而是将J-Space前后的表现与V4-Flash和三类自建任务进行对比。

第二轮共运行12次,两组完成任务的情况基本一致。接入J-Space后,Token和时间消耗更多。这只能说明J-Space在这组测试条件下并没有带来明显的提升,无法推翻项目方的成绩。

要理解为什么这些数字不能直接比较,首先要区分Benchmark和Harness。

如果把模型当成考生,Benchmark就是试卷,而Harness就是模型拿到试卷后使用的一套完整的答题系统。它决定了模型可以看到哪些文本,调用哪些工具,如何保存进度,以及错误后是否可以检查和重新开始。

在此之前,Harness很少出现在排行榜的显眼位置,但是它对成绩的影响已不再被视为脚注。

五月七日提交给arXiv《Stop Comparing LLM Agents Without Disclosing the Harness》,在同一批100个编程任务中,将三个模型分别放入三套Harness中进行测试。模型、任务和运行限制一致,只更换Harness,同一模型的通过率最多相差13。%,模型排名也发生了6次翻转。

Harness-Bench的另一项研究是在统一环境和资源预算下,准备了106个沙盒任务来测试不同的“模型”+Harness“组合,共记录5194条执行轨迹。研究人员不仅要看任务是否完成,还要保留工具调用、Token消耗、错误和评分结果。

这些研究不能直接证明J-Space是否有用,但它反映了排名表中正在发生的变化:当任务需要连续操作并调用工具来处理错误时,同一个模型可以通过更换Harness来获得另一个结果,甚至更改排名。

制造商开始在成绩单中写入Harness。

假如Harness只影响一些研究论文,它也可以被视为评估中的技术细节。但是模型制造商已经开始主动将其写入成绩单。

Kimi于七月发布 K3技术报告,Harness被标记在许多智能体和编程结果旁边,包括Kimimi。 Code、Claude Code和Codex。一些评估还进一步说明了操作次数、推理强度、前后策略,以及在测试过程中遇到的拒绝和降级。

 

免责声明:网站内容仅作资讯展示,不构成各类业务指导建议。访问者应当自行甄别信息,审慎评估风险,因使用本站信息产生的相关后果由使用者自行承担。本站尊重各方知识产权,如有侵权内容,可联系站长进行处理。