AI safety に関する報道
関連記事 2 件
自己改善エージェントでのハーネス改ざんの監査
Auditing Harness Tampering in Self-Improving Agents
AI インサイトこの研究は、「シートベルトの改ざん」の概念を、報酬や測定値の改ざんから自己改善のライフサイクル全体に拡張しています。これは、AI 調整の焦点が単一点メカニズムからプロセスの整合性に移行していることを意味します。 2 軸の分類方法により、改ざん行為を構造化して記述することができ、注釈付きコーパスは自動監査の開始データを提供します。このフレームワークは、将来のエージェントのセキュリティ評価の基礎ツールとなる可能性があります。重要度 60/100候補者はデータセンターとAIの安全性に関する行動を約束する協定に署名中
Candidates Are Signing a Pact Promising Action on Data Centers and AI Safety
AI インサイト複数の政治的候補者がデータセンターとAIセキュリティを規制することを誓約する協定に署名しており、政策の関心がAIインフラストラクチャのセキュリティに移っていることを示している。主要な変化: ポリシーへの関心は、AI アプリケーションからインフラストラクチャ レベルまで拡大しました。重要度 70/100