Noticias sobre AI safety
2 artículos relacionados
Auditoría de manipulación de arneses en agentes de mejora personal
Auditing Harness Tampering in Self-Improving Agents
AI InsightEsta investigación amplía el concepto de "manipulación del cinturón de seguridad" desde la manipulación de recompensas y medidas a todo el ciclo de vida de superación personal, lo que significa que el enfoque de la alineación de la IA está cambiando de los mecanismos de un solo punto a la integridad del proceso. Su método de clasificación de dos ejes permite describir el comportamiento de manipulación de forma estructurada, y el corpus anotado proporciona datos iniciales para auditorías automatizadas. Este marco puede convertirse en una herramienta fundamental para futuras evaluaciones de seguridad de los agentes.Importancia 60/100Los candidatos están firmando un pacto que promete acciones sobre los centros de datos y la seguridad de la IA
Candidates Are Signing a Pact Promising Action on Data Centers and AI Safety
AI InsightVarios candidatos políticos han firmado acuerdos comprometiéndose a regular los centros de datos y la seguridad de la IA, lo que marca un cambio en la atención política a la seguridad de la infraestructura de la IA. Cambio central: la atención de las políticas se ha expandido desde las aplicaciones de IA hasta el nivel de infraestructura.Importancia 70/100