Saltar al contenido principal
Zubnet AIAprenderWiki › Inocuidad de la IA
Seguridad

Inocuidad de la IA

También conocido como: AI Safety
El campo de investigación e ingeniería que busca lograr que los sistemas de IA se comporten de forma fiable, predecible y acorde con las intenciones humanas. Abarca alineación, interpretabilidad, robustez, evaluación y gobernanza, e incluye tanto daños a corto plazo como la alucinación y el sesgo como preocupaciones a más largo plazo sobre sistemas de gran capacidad. Es distinto de la seguridad de la IA, que protege los sistemas contra atacantes externos en vez de corregir el comportamiento del propio sistema.

Por qué importa

Cada modelo lanzado a los usuarios lleva consigo modos de fallo — hechos alucinados, salvaguardas vulnerables a jailbreaks, decisiones sesgadas, agentes que toman acciones no previstas —, y esos fallos escalan con el uso. El trabajo de inocuidad es lo que transforma "la demostración funcionó" en "el sistema resiste ante millones de usuarios y presión adversarial", y los reguladores lo tratan cada vez más como un requisito jurídico y no como algo deseable pero opcional.

En profundidad

Inocuidad de la IA es un término paraguas, y su amplitud es parte de la idea. En el extremo de la investigación está la Alineación: conseguir que un modelo haga realmente lo que pretenden sus operadores, algo que resulta difícil porque los objetivos de entrenamiento siempre se limitan a aproximar la intención. Alrededor de ese núcleo hay disciplinas de apoyo — interpretabilidad para ver qué hace internamente un modelo, evaluaciones y red teaming para medir capacidades peligrosas y modos de fallo antes del despliegue, trabajo de robustez para que el comportamiento se mantenga ante cambios de distribución y entradas adversariales, y gobernanza para convertir todo ello en práctica institucional. El campo ya tiene sus propias instituciones: Anthropic fue fundada explícitamente como un laboratorio centrado en la inocuidad, Google DeepMind dirige equipos dedicados a ella, el Center for AI Safety (CAIS) se centra en investigación y concientización pública, y Safe Superintelligence de Ilya Sutskever, fundada en 2024, trata la superinteligencia segura como su único objetivo.

El problema de la alineación

La pregunta central de la inocuidad de la IA es la alineación: ¿cómo consigues que un sistema optimizado para predecir el siguiente token persiga de forma fiable lo que realmente quiere su operador? El problema de especificación es el quid — las señales de entrenamiento solo aproximan la intención, y los modelos son muy buenos para encontrar la brecha entre lo que recompensaste y lo que querías decir. La práctica actual ataca esto durante el post-entrenamiento: RLHF ajusta los modelos contra un modelo de recompensa aprendido de preferencias humanas, mientras enfoques como la IA Constitucional hacen que el modelo critique y revise sus propias salidas frente a un conjunto explícito de principios. Los modos de fallo están bien documentados. La Adulación, donde un modelo dice a los usuarios lo que quieren oír en vez de la verdad, es un artefacto directo del entrenamiento sobre aprobación humana. La explotación de recompensas — optimizar técnicamente la métrica mientras se viola su espíritu — aparece en todas partes, desde agentes que juegan hasta chatbots que aprenden a parecer seguros en vez de tener razón.

Abrir la caja negra

No puedes verificar por completo lo que no puedes ver, razón por la que la interpretabilidad se ha convertido en una disciplina central de la inocuidad. La Interpretabilidad mecanicista intenta aplicar ingeniería inversa a las redes neuronales para obtener componentes comprensibles para los humanos, identificando características y circuitos en vez de tratar el modelo como una función opaca. El campo recibió un gran impulso de la técnica del Autoencoder disperso, que descompone las activaciones internas de un modelo en grandes cantidades de características interpretables; Anthropic lo demostró célebremente en Claude al encontrar y amplificar una característica del "puente Golden Gate", lo que hizo que el modelo hablara obsesivamente del puente. El beneficio para la inocuidad es concreto: si puedes identificar representaciones internas de engaño, sesgo o conocimiento peligroso, puedes vigilar o dirigir comportamientos a los que los prompts por sí solos no llegan. La salvedad honesta es que la interpretabilidad todavía está en una fase temprana — las técnicas actuales explican fragmentos del comportamiento de un modelo, no sistemas completos.

No se trata solo de la superinteligencia

Dos ideas equivocadas persiguen a la inocuidad de la IA. La primera es que el campo solo trata de escenarios de ciencia ficción — superinteligencia rebelde y Riesgo Existencial. Esas preocupaciones son una parte real del campo, pero la mayor parte de la investigación activa en inocuidad es ingeniería a corto plazo: reducir la alucinación, prevenir salidas discriminatorias, evitar que los agentes tomen acciones dañinas y medir lo que un modelo puede hacer antes de lanzarlo. La segunda idea equivocada es que la inocuidad y la Seguridad de la IA son lo mismo. La seguridad protege un sistema de atacantes externos — prompt injection, exfiltración de datos, robo del modelo —, mientras la inocuidad se ocupa del comportamiento propio del sistema incluso cuando nadie lo ataca. Ambas se superponen mucho en la práctica, pero tienen modelos de amenazas, herramientas y, por lo general, equipos distintos.

Inocuidad en producción

Para los sistemas desplegados, el trabajo de inocuidad es ingeniería poco glamorosa. El patrón estándar es la defensa en profundidad: Salvaguardas que filtran entradas y salidas, prompts de sistema que codifican límites de comportamiento, entrenamiento de negativas durante el post-entrenamiento y vigilancia que marca comportamientos anómalos en producción. La presión adversarial es constante — los ataques de Prompt Injection engañan a los modelos para que ignoren sus instrucciones, y los jailbreaks siguen evolucionando más rápido que las defensas. El red teaming, con equipos internos o investigadores externos, es la forma en que los laboratorios serios encuentran estos agujeros antes que los usuarios. La conclusión para los profesionales: ninguna capa basta por sí sola, y una estrategia de inocuidad compuesta únicamente por entrenamiento de negativas no sobrevivirá al contacto con usuarios motivados.

Gobernanza y regulación

La capa más reciente del campo es institucional: convertir la inocuidad de investigación voluntaria en práctica exigible. La EU AI Act es el ejemplo más desarrollado e impone obligaciones escalonadas por riesgo a los sistemas de IA y requisitos específicos a los modelos de propósito general que presentan riesgo sistémico. Los laboratorios de frontera han respondido con sus propios marcos — la Responsible Scaling Policy de Anthropic y documentos similares de otros laboratorios se comprometen con umbrales de evaluación que activan precauciones más fuertes a medida que crecen las capacidades. Los compromisos voluntarios, las auditorías externas, las fichas de modelos y los informes de incidentes se están convirtiendo lentamente en expectativas básicas en vez de diferenciadores. Cuánto puede esta capa de Gobernanza de la IA mantener el ritmo de los avances de capacidades es una de las preguntas genuinamente abiertas del campo.

← Todos los términos
ESC