开源利器!让DeepSeek V4 Flash超越Fable 5,还省11倍

发布时间:2026年08月20日 来源:算泥 作者:suani 浏览量:6

不得了!

使用 DeepSeek V4 Flash 进行自我验证,竟然能在 Terminal-Bench 2.1 上表现超越 Claude Fable 5,而其成本则低了 11 倍。

图片

图片

怎么做到的?这就是斯坦福,加州大学伯克利分校和英伟达研究院刚刚开源的 LLM-as-a-Verifier。

图片

不训练,只验证

研究者提出了 LLM 作为验证器的方法,一种通用框架,它能够为任何类型的问题提供细粒度的反馈,而无需额外的训练过程。

图片

通过充分利用评分令牌的 logits,该方法能够捕捉评估中的不确定性,并使验证能够在三个维度上进行扩展:评分的粒度、重复评估的频率以及评估标准的分解。

其核心思想很简单:使用细粒度的评分粒度;基于 LLM 评分 Token 的整个对数概率分布进行期望值的计算;通过重复评估和多层次标准分解来实现反馈的细化。

而且,这种细粒度的反馈可以用于测试时扩展(Test-Time Scaling)、进度跟踪以及强化学习。

从编程到机器人

LLM-as-a-Verifier 应用于测试时扩展,在编程、机器人技术和医学领域均展现了顶尖的性能。

图片

Terminal-Bench V2 测试集上的表现达到了 86.5%,SWE-Bench 验证集上的表现为 78.2%,RoboRewardBench 测试集上的表现是 87.4%,而 MedAgentBench 测试集上的表现则为 73.3%。

将 LLM-as-a-Verifier 作为一种密集的奖励信号,能够提升无论是离线策略还是在线策略强化学习算法的样本效率。

图片

在 LIBERO 任务上,当使用 SAC 方法对 π0 策略进行微调时, LLM-as-a-Verifier 方法比稀疏奖励基线的算法效率高出约 1.8 倍。

在 MATH 推理任务上,当使用 GRPO 方法对 Qwen3-8B 模型进行微调时,其样本效率则高出约 1.1 倍。

将 LLM-as-a-Verifier 用于进度跟踪,还能发现 Agent 任务成功或失败的细节。

图片

研究者发现,代码生成步骤的时间推进与 LLM-as-a-Verifier 的评分之间存在强烈的相关性。

LLM-as-a-Verifier 还能够在机器人部署过程中产生平稳且时间上对齐的进度信号,同时能够抵御诸如意图错误或抓取不准确等故障模式的影响。

图片

生产不是瓶颈,验证才是

研究者认为,生产环节并不是瓶颈,验证才是关键。

大多数 Agent 已经知道如何解决这些任务。在 Terminal-Bench 测试中,如果反复为每个任务生成 100 条轨迹进行训练,这些 Agent 的表现可以超越 Claude Mythos,甚至几乎能够完全解决整个测试集。

图片

问题在于,它们并不清楚哪条路径是正确的,尤其是在处理长周期任务时。

虽然可以使用标准的 LLM 作为裁判,但它们无法提供足够细粒度的反馈。在比较复杂的解决方案时,裁判们往往给出相同的评分,导致出现平局,无法区分不同的解决方案。

应该将验证作为新的扩展维度。随着 LLM-as-a-Verifier 在多个维度上的扩展,验证的准确性会持续提高。

图片

在诸如 Terminal-Bench V2、SWE-Bench Verified 和 MedAgentBench 等具有挑战性的测试基准中, LLM-as-a-Verifier 表现优于包括 Claude Opus 4.8、GPT 5.5 以及 Gemini 模型在内的前沿模型。

图片

在 RoboRewardBench 上,LLM-as-a-Verifier 比经过微调的机器人奖励模型表现更优。

图片

LLM-as-a-Verifier 揭示了一条被长期忽视的路径:智能的天花板,不取决于你能生成多少答案,而取决于你能否分辨哪个答案是对的。

当生成已经足够廉价,当一百条轨迹可以随手铺展在桌面上,真正稀缺的能力不再是“想出来”,而是“看出来”。

验证,正成为参数规模、数据体量、推理算力 Scaling 轴之外的智能变量。

这不需要额外的训练,不需要标注数据,不需要专门的奖励模型,只需要验证 LLM 在输出评分 Token 时,那个概率分布里藏着的犹豫与确信。

让模型变得更会“说”,与让模型变得更会“判”,同样重要。

参考资料:

https://llm-as-a-verifier.com/

https://github.com/llm-as-a-verifier/llm-as-a-verifier

https://arxiv.org/pdf/2607.05391

免责声明:本文来自算泥客户端,不代表超天才网的观点和立场。文章及图片来源网络,版权归作者所有,如有投诉请联系删除。

0 0 0
有话要说 0 人讨论    6 人阅读

热门文章

超天才网©2017 www.supergenius.cn All Rights Reserved ICP备09005826号 京ICP证130304号

联系我们| 加入我们| 法律声明| 关于我们| 评论互动

超天才网©2013-2014 All Rights Reserved 京ICP备09005826号-2 京ICP证130304号

京公网安备 11010802036640号

关注我们: