OpenAI anunció que apoyará evaluaciones independientes de terceros, al señalar que los laboratorios de inteligencia artificial de frontera son responsables de la formación, evaluación y despliegue seguros de los modelos. El objetivo de estos trabajos es poner a prueba las afirmaciones de seguridad, revelar riesgos que hayan pasado inadvertidos y aumentar la rendición de cuentas de los laboratorios. Se indicó que los evaluadores podrían tener acceso, durante los procesos de formación, evaluación y despliegue, a medidas técnicas de seguridad, al acceso al chain of thought, a datos confidenciales y a sistemas internos de despliegue para la respuesta a incidentes.
OpenAI definió la «afirmación de seguridad» como una expresión concreta relacionada con la seguridad de un modelo o sistema que puede ponerse a prueba mediante pruebas, y el «expediente de seguridad» como un argumento estructurado que explica, con pruebas, que los riesgos están gestionados adecuadamente para una actividad concreta. Se señaló que las evaluaciones podrían durar semanas o varios meses, que distintos estudios podrían llevarse a cabo en paralelo y que se centrarían especialmente en examinar determinadas afirmaciones de seguridad a largo plazo.
Las cuatro áreas prioritarias para una evaluación más exhaustiva se enumeraron de la siguiente manera:
- Revisión independiente de los expedientes de seguridad que abarcan la formación, la evaluación, la distribución interna y la distribución externa; evaluación de si las afirmaciones de seguridad están respaldadas por pruebas, de si se cumplen las condiciones del proceso y de si se cubren los riesgos críticos.
- Revisión de las medidas de seguridad críticas en las distribuciones internas y externas; prueba de la resiliencia frente a los jailbreaks, los aumentos de capacidades de alto riesgo en los ámbitos cibernético, biológico y químico, las defensas cibernéticas y las brechas en los monitores de desalineación del modelo.
- Revisión de las evaluaciones de capacidades que abarcan las categorías de riesgo de Preparedness, es decir, Chemical and Biological Risks, Cybersecurity y AI Self-Improvement, así como de las evaluaciones relativas a riesgos graves de desalineación; comprobación de la vigencia de los umbrales y las pruebas.
- Investigación independiente de incidentes críticos de desalineación del modelo, como el comportamiento no autorizado o la evasión de la supervisión; investigación de las causas del incidente y de si las medidas de seguridad y las correcciones pueden prevenir incidentes similares.
Se explicó que los principios consisten en determinar de antemano y conjuntamente el alcance y las afirmaciones, un acceso proporcional, métodos y estándares transparentes, conocimientos especializados e independencia, seguridad de la información y confidencialidad, hallazgos aplicables para la corrección, así como una publicación responsable basada en pruebas y que proteja la información sensible. Se subrayó que los evaluadores deben revelar los conflictos de intereses, cumplir las condiciones de seguridad e indicar las incertidumbres en sus informes. OpenAI declaró que apoyará el ecosistema de evaluadores independientes y el desarrollo de estándares internacionales comunes.
Por qué es importante
Este enfoque busca trasladar la seguridad de la inteligencia artificial a un marco de auditoría en el que expertos externos puedan examinar las pruebas y los procesos, en lugar de evaluarla únicamente a partir de las declaraciones de los propios laboratorios. De este modo, los expedientes de seguridad de los desarrolladores, la suficiencia de las pruebas y sus respuestas ante incidentes críticos pueden ser examinados desde fuera de las instituciones. El marco amplía especialmente el alcance de la revisión independiente en ámbitos como las capacidades cibernéticas, biológicas y químicas de alto riesgo, así como la posibilidad de que el modelo eluda la supervisión. Sin embargo, el equilibrio entre el acceso de los evaluadores a datos sensibles y la publicación responsable sigue siendo la cuestión fundamental que determinará hasta qué punto los hallazgos se reflejarán públicamente. La búsqueda de estándares internacionales comunes también reviste importancia para que distintas evaluaciones puedan compararse.