关于 ARC-AGI 的报道
共 1 篇相关报道
克劳德寓言 5.1 在 ARC-AGI 上的结果
Claude Fable 5.1 results on ARC-AGI
AI 洞察Claude Fable 5.1 在 max effort 下 ARC-AGI-1 Semi-Private 得分 97.5%($1.40/任务),ARC-AGI-2 得分 90.0%($4.49/任务)。这意味着新模型在抽象推理基准上达到高水准,且成本透明,为后续模型效率对比提供锚点。核心结论新模型在 ARC-AGI-2 上首次公开达到 90% 成绩。为什么重要ARC-AGI-2 高难推理获 90% 分数,直接量化模型抽象能力与成本,影响后续基准评测门槛。影响谁- AI 研究者可参照该成绩评估自身模型的抽象推理差距。
- 开发者按任务成本 $1.40/$4.49 估算推理开销并选型。
- 模型提供商需在 ARC-AGI-2 上对标 90% 这一新标杆。
后续看点关注 ARC-AGI-3 是否发布评测,以及同路线模型能否超越 97.5% 上限。重要度 70/100