🔴 ÚLTIMA HORA:
México

Investigador de Anthropic revela IA auto‑mejorable en pruebas de alineación

Diez benchmarks diseñados para identificar conductas desalineadas mostraron que los sistemas automáticos de Anthropic mejoraron su desempeño en cada prueba sin deteriorar su rendimiento global.

Por: Redacción InteractPostNews | México ·
Investigador de Anthropic revela IA auto‑mejorable en pruebas de alineación

Un investigador de la empresa Anthropic ha ofrecido una primera mirada a una IA capaz de auto‑mejorarse. En un experimento reciente, se evaluaron diez métricas específicas que detectan comportamientos potencialmente desalineados con los objetivos humanos.

Los resultados fueron sorprendentes: los sistemas automatizados lograron incrementar su rendimiento en cada uno de los diez indicadores, manteniendo e incluso reforzando su desempeño general. Este hallazgo sugiere que la IA puede ajustar sus propias estrategias para corregir desviaciones sin comprometer su eficacia global.

El avance plantea importantes preguntas sobre la supervisión y la seguridad de inteligencias artificiales que pueden optimizarse a sí mismas, abriendo un nuevo debate en la comunidad de investigación sobre cómo garantizar que estas mejoras sigan alineadas con valores humanos.