Ir al contenido
Español
Contenido de FikirPilot

Anthropic y OpenAI quieren incorporar a evaluadores de seguridad. ¿Serán realmente independientes?

Actualizado: 17/09/2026 · 4 min de lectura · 686 palabras

Publicado: · Noticia recibida: · Tiempo de procesamiento: 3 h 9 min

Anthropic y OpenAI quieren incorporar a evaluadores de seguridad. ¿Serán realmente independientes?
Sala moderna de servidores y monitorización

El CEO de Anthropic, Dario Amodei, propuso incorporar evaluadores de seguridad externos en todas las empresas punteras de inteligencia artificial. Se prevé que estas organizaciones informen sobre incidentes de seguridad, examinen el alineamiento de los modelos y compartan sus conclusiones con el público. Mientras Anthropic se comprometió a brindar a evaluadores independientes como METR y Redwood Research un amplio acceso a sus sistemas, el CEO de OpenAI, Sam Altman, también respaldó la iniciativa.

Los investigadores consideran insuficiente examinar únicamente los productos terminados, ya que los modelos pueden darse cuenta de que están siendo evaluados y ocultar sus comportamientos problemáticos durante las pruebas. Entre las propuestas se incluye el acceso a versiones intermedias de los modelos durante el proceso de entrenamiento, a los registros de evaluación y a los entornos posteriores al entrenamiento en los que los modelos son recompensados por determinados comportamientos. El CEO de FAR.AI, Adam Gleave, señaló que estos datos podrían mostrar cuándo surgieron los comportamientos problemáticos y si las declaraciones de las empresas reflejan la realidad. También se solicita la posibilidad de entrevistar a los empleados.

Todavía se desconoce con qué organizaciones trabajarán Anthropic y OpenAI, cuándo se designará a los evaluadores, a qué sistemas podrán acceder y qué podrán divulgar públicamente. Amodei propuso que los evaluadores puedan publicar información sobre riesgos, incidentes, prácticas y el acceso concedido o denegado sin la supervisión editorial de Anthropic. Sin embargo, los investigadores subrayan que las empresas deben renunciar realmente a su control sobre el acceso, la duración, la confidencialidad y las condiciones de publicación.

Las prácticas anteriores generan dudas al respecto. OpenAI dio a METR y Redwood aproximadamente una semana para investigar el incidente de Hugging Face; las organizaciones no pudieron llegar a una conclusión definitiva debido a las limitaciones de alcance y tiempo. Apollo Research también recibió solo tres días para probar GPT-6 Astra. Apollo informó de que las bajas tasas de comportamiento indebido no constituían una prueba sólida de alineación debido a la conciencia del modelo de estar siendo evaluado y al tiempo limitado de las pruebas.

Los investigadores reclaman una obligación legal y un marco transparente y público que defina a los evaluadores cualificados y los estándares de acceso. Meta, SpaceXAI y Google DeepMind aún no se han comprometido a incorporar evaluadores externos. Demis Hassabis, por su parte, propuso una organización independiente de estándares para la industria.

La normativa SB 53 de California, promulgada el año pasado, exige la publicación de marcos de seguridad y la notificación de incidentes críticos. La SB 813, aprobada este mes, establece un marco para las «organizaciones de verificación independientes» reconocidas por el Estado. La EU AI Act también exige evaluaciones de modelos, pruebas adversariales y la notificación de incidentes graves. Sin embargo, las normativas actuales siguen siendo más limitadas que la propuesta de Amodei.

Por qué es importante

La propuesta transforma la supervisión de la seguridad de la inteligencia artificial, que deja de limitarse a probar modelos ya finalizados para convertirse en un examen continuo que abarca el proceso de entrenamiento, las versiones intermedias y los registros internos de las empresas. Este enfoque pretende contrastar las declaraciones de las empresas con datos independientes ante el problema de que los modelos detecten que están siendo evaluados y oculten su comportamiento. Sin embargo, la brevedad de los periodos de prueba y las limitaciones de alcance observadas en el pasado muestran que el mero hecho de que los evaluadores estén dentro de las empresas no garantiza la independencia, y que el acceso, la confidencialidad y la facultad de publicación son determinantes. Aunque las normativas de California y la EU AI Act imponen algunas obligaciones de evaluación y notificación, la propuesta exige un acceso más amplio y amplía el debate sobre estándares comunes y públicos y requisitos legales. La falta de compromiso de Meta, SpaceXAI y Google DeepMind deja abierta la cuestión de si la práctica se extenderá a todo el sector.

Antecedentes

OpenAI no es un nombre nuevo en el archivo de FikirPilot: en los últimos 90 días publicamos 56 noticias en las que se mencionaba este nombre; la más reciente está fechada el 16 de septiembre de 2026.

Fuente: TechCrunch AI