PRISM に関する報道
関連記事 1 件
$\textit{What If}$ の錯覚: LLM における反事実推論の内訳の評価
The Illusion of $\textit{What If}$: Evaluating the Breakdown of Counterfactual Reasoning in LLMs
AI インサイトarXiv の新しい研究では、初のオープンドメインの長距離反事実因果推論ベンチマークである WhatIfBench が提案されており、これには 220 の STEM、HSS、混合質問が含まれています。また、自然言語の説明を意味因果関係グラフに変換して自動評価する PRISM が装備されています。限定された変数と単一の標準的な回答による以前のベンチマークと比較して、今回はオープンドメインおよびオープン形式の因果プロセス評価に変わり、反事実推論評価の盲点を埋めます。重要度 62/100