Qwen2.5-VL-72B に関する報道
関連記事 1 件
大規模な言語モデルはレビュー内容を精査していますか?スコア調整、エラー検出、および作成者のアイデンティティ効果のマルチモーダル監査
Do large language models scrutinise what they review? A multimodal audit of scoring calibration, error detection, and author-identity effects
AI インサイトこの研究では、ICLR 2026 の提出審査において 2 つのマルチモーダル LLM のパフォーマンスを体系的にテストし、これらは著者名や図の情報に敏感であり、エラー検出機能が限られていることがわかりました。 LLM によって生成されたレビュー内容のみを評価していた過去と比較して、今回はアイデンティティバイアスと誤認の観点から LLM レビューの具体的な限界が初めて明らかになりました。重要度 82/100