关于 Terminal-Bench-Science 的报道
共 1 篇相关报道
克劳德寓言 5.1 让我成为了一只非常漂亮的动画鹈鹕
Claude Fable 5.1 made me a really nice animated pelican
AI 洞察Anthropic发布Claude Fable 5.1,其Terminal-Bench-Science得分从5.0的24.7%跃升至52.6%。相比此前模型将推理能力设为可选项,Fable 5.1强制内置五档推理强度且无法完全关闭。这表明Anthropic正将深度推理作为模型默认基础能力,而非附加开关。核心结论相比此前推理可关闭,新模型强制内置五档推理。为什么重要推理机制从可选附加变为强制默认,将重构开发者调用习惯与token消耗预期。影响谁- 开发者必须适配五档推理强制机制,无法再通过关闭推理来压缩成本或延迟。
- AI 研究者强制推理对科学任务基准的显著提升效果,为推理缩放路线提供新数据点。
后续看点关注五档强制推理对普通应用场景延迟和成本的具体影响,以及业界是否跟进。重要度 70/100