Articles sur AI safety
2 articles liés
Audit de la falsification du harnais chez les agents auto-améliorés
Auditing Harness Tampering in Self-Improving Agents
AI InsightCette recherche étend le concept de « falsification de la ceinture de sécurité » de la falsification des récompenses et des mesures à l'ensemble du cycle de vie de l'auto-amélioration, ce qui signifie que l'accent de l'alignement de l'IA passe des mécanismes ponctuels à l'intégrité des processus. Sa méthode de classification à deux axes permet de décrire les comportements de falsification de manière structurée et le corpus annoté fournit des données de départ pour les audits automatisés. Ce cadre pourrait devenir un outil fondamental pour les futures évaluations de la sécurité des agents.Importance 60/100Les candidats signent un pacte prometteur sur les centres de données et la sécurité de l’IA
Candidates Are Signing a Pact Promising Action on Data Centers and AI Safety
AI InsightPlusieurs candidats politiques ont signé des accords s’engageant à réglementer les centres de données et la sécurité de l’IA, marquant un changement d’attention politique vers la sécurité des infrastructures d’IA. Changement fondamental : l’attention politique s’est étendue des applications d’IA au niveau de l’infrastructure.Importance 70/100