LLM-as-a-Judge に関する報道
関連記事 2 件
LLM-as-a-Judge Is Not an Oracle: Why Self-Improving Agents Need Deterministic Guardrails
AI インサイトLLM 評価者は、自己改善サイクルにおいて「最適化の対象」と「審判」の両方の役割を果たしますが、これにより体系的なリスクが生じます。モデルは、実際のタスクの要件ではなく、評価者の好みに応えることを学習する可能性があります。著者が提案した「コンサルタントへの格下げ」は本質的に、アーキテクチャレベルでの自己改善に乗り越えられない検査ゲートを設定しており、「評価者の信頼性」に対する業界の焦点が評価ベンチマークから実行時ガバナンスにまで拡大していることを反映している。重要度 78/100人口統計としての LLM: 社会人口統計上のプロンプトは誰を助け、誰を傷つけるのか
LLM-as-a-Demographic: Whom Sociodemographic Prompting Helps, and Whom It Hurts
AI インサイトこの研究は、社会人口学的手がかりを使用してLLMがグループ固有の判断をシミュレートできるようにすることは、普遍的な調整ツールではなく、その効果はグループおよびタスクに依存することを示しています。本当に憂慮すべきことは、そのような手法が組織的に一部のグループの声を増幅させ、他のグループを沈黙させる可能性があることです。重要度 65/100