HappyHorse与Wan3.0赛马,谁是阿里版Seedance?

Skill不改变模型权重,可以使DeepSeekekill。 V4 ProClaude“秒杀”海外顶级模型 Fable 5?

J-第三方SkillSpace项目配套报告显示,V4-Pro-7个智能体和编程评估在0813接入这个Skill后超过了Fable。 5参照成绩。

随后,另一组开发人员进行了A/B测试,但是他们没有看到任务完成率的提高。取而代之的是,他们花更多的时间浏览J-Space组。

谁是对的?目前还无法得出结论。模型的使用和任务的两侧不同,考试也不同。

但这一争议暴露了排行榜上的一个漏洞:今天写在模型名下的成绩,越来越多的是模型,Harness、前后文、工具再试策略共同产生。

排行榜还在给模型排座位,真正参加比赛的已经是一个完整的执行系统。

在智能体和编程任务中,只公布模型名称和最终结果的大模型排名,失去了解释力。

第一,更换一套Harness,同一个模型可以改变排名。

先看J-Space的“秒杀”是如何得到的。

项目报告显示,V4-Pro-0813接入J-Space后,Terminal Bench 从2.1到90.1的87.9分,Fable 5分为88.0分,DeepSWE从62.7分上升到72.0分,Fable 5为70.0分;Toolathlon-Verified从74.1分上升到79.5分,Fable 5为77.9分。

在报告中列出的七个比较中,DeepSeek都取得了较高的成绩。但是,这并不是在相同的条件下进行的正面对比:DeepSeek的分数由J-Space项目方测量,Fable 5的分数来自制造商的公开信息。双方使用的Harness、资源预算和运行设置不统一。

八月十七日,另一组开发人员进行了不同的测试。他们没有使用V4。-Pro-0813,也没有重跑以上7项评估,而是将J-Space前后的表现与V4-Flash和三类自建任务进行比较。

第二轮共运行12次,两组完成任务的情况基本一致。Token和时间在接入J-Space后消耗更多。这只能说明J-Space在这组测试条件下并没有带来明显的提升,无法推翻项目方的成绩。

要理解为什么这些数字不能直接比较,首先要区分Benchmark和Harness。

如果把模型当成考生,Benchmark就是试卷,而Harness就是模型拿到试卷后使用的完整答题系统。它决定了模型能看到什么文本,调用什么工具,如何保存进度,错误后能否检查和重新开始。

此前,Harness很少出现在排行榜的显眼位置,但它对成绩的影响已经不再被视为脚注。

向arXiviv提交5月7日《Stop Comparing LLM Agents Without Disclosing the Harness》,在同一批100个编程任务中,将三个模型放入三套Harness中进行测试。模型、任务和运行限制是一致的,只更换Harness,同一模型的通过率最多相差13。%,同时,模型排名也发生了6次旋转。

Harness-在统一的环境和资源预算下,Bench的另一项研究是准备了106个沙盒任务来检测不同的“模型”+Harness“组合,共记录5194条执行轨迹。研究人员不仅要看任务是否完成,还要保留工具调用、Token消耗、错误和评分结果。

这些研究不能直接证明J-Space是否有用,但它反映了排名表中正在发生的变化:当任务需要连续操作并调用工具来处理错误时,同一模型可以通过更换Harness来获得另一个结果,甚至更改排名。

制造商开始将Harness写入成绩单。

如果Harness只影响一些研究论文,那么它也可以被视为评估中的技术细节。然而,模型制造商已经开始主动将其写入成绩单。

七月份发布了Kimi K3技术报告,Harness被标记在包括Kimimimi在内的许多智能体和编程结果旁边。 Code、Claude Code和Codex。有些评估还进一步反映了操作频率、推理强度、前后策略,以及在测试过程中遇到的拒绝和降级。

 

 

免责声明:网站内容仅作资讯展示,不构成各类业务指导建议。访问者应当自行甄别信息,审慎评估风险,因使用本站信息产生的相关后果由使用者自行承担。本站尊重各方知识产权,如有侵权内容,可联系站长进行处理。