¿Cómo sería una estrategia de validación para IA probabilística bajo GMP? Debería demostrar, de forma proporcional al riesgo para el paciente y el producto, que el uso previsto está definido, los modos de fallo se comprenden, las salvaguardas son eficaces, la supervisión humana responsable es viable y el rendimiento permanece controlado durante actualizaciones, reentrenamiento y deriva. Esto aún no es un requisito final de Annex 22: el taller de la EMA de junio-julio de 2026 se diseñó para recopilar evidencia experta para el desarrollo de la guía. Sin embargo, sus preguntas publicadas indican las cuestiones para las que los fabricantes deberían prepararse.
Para responsables de QA, Validación, Data Integrity, IT/OT y fabricación, la respuesta útil no es esperar un texto final. Es separar la experimentación de bajo riesgo del uso GMP, establecer una gobernanza de IA basada en evidencia y comprobar si los controles resistirían cuando el modelo se equivoca, es incierto, cambia o queda fuera del control directo del fabricante.
Lo que ha dicho la EMA sobre Annex 22
La EMA describe Annex 22 como una guía de la UE sobre el uso de inteligencia artificial en la fabricación de medicamentos. Su taller multistakeholder de dos días tuvo lugar el 30 de junio y el 1 de julio de 2026. El primer día fue una sesión abierta para opiniones y evidencia de expertos; el segundo, una sesión cerrada en la que el grupo de redacción de Annex 22 revisó las contribuciones. La EMA indicó que esperaba que el taller produjera un informe con aportaciones de expertos.
Según la EMA, una consulta de partes interesadas de 2025 sobre el borrador de Annex 22 sugirió apoyo a tecnologías potencialmente habilitadoras, como la IA generativa y los large language models (LLM), en la fabricación de medicamentos. El borrador indicaba que los modelos dinámicos, adaptativos y probabilísticos, incluidos GenAI y LLM, no deberían utilizarse en aplicaciones GMP críticas. La EMA declaró que aún consideraba las implicaciones de la consulta y buscaba aportaciones de expertos sobre posibles controles y mitigaciones de riesgo, incluidas las guardrails, dentro de un enfoque propuesto basado en el riesgo.
Hecho regulatorio: la página del taller plantea preguntas; no establece por sí misma que una guardrail, un método de validación o un modelo concreto de revisión humana sea aceptable. Interpretación de GuideGxP: un paquete genérico de validación de software o una declaración de garantía del proveedor por sí solos difícilmente justificarán el uso de IA probabilística en un flujo de trabajo GMP de alto riesgo.
Por qué la IA probabilística cambia la validación
La validación de sistemas informatizados GMP se centra normalmente en demostrar que un sistema especificado funciona de forma consistente para su uso previsto. La IA probabilística añade un reto distinto: el mismo prompt o contexto de entrada no siempre puede producir resultados idénticos, y un modelo puede generar contenido plausible pero incorrecto. En sistemas adaptativos, el comportamiento también puede cambiar tras el reentrenamiento, actualizaciones del modelo o deriva de datos.
Esto no vuelve inutilizable toda la IA. Significa que la afirmación de validación debe ser precisa. Un fabricante no debería intentar validar un modelo como universalmente «exacto» o «seguro». Debe validar un caso de uso controlado, sus límites de entrada, su salida permitida, los derechos de decisión que conservan las personas y los controles técnicos y procedimentales que previenen o detectan resultados inaceptables.
Las preguntas de la EMA conectan esta cuestión con consecuencias GMP: alucinaciones, recomendaciones incorrectas, datos fabricados, escalado de incidentes, Data Integrity, control de proceso, auditabilidad, trazabilidad, ciberseguridad, infraestructura externalizada y límites de las mitigaciones. Es un problema de sistema completo, no solo de rendimiento del modelo.
Estrategia práctica de validación para IA utilizada en GMP
1. Definir el uso previsto y el uso prohibido
Comience con una declaración de uso previsto acotada. Debe identificar el proceso GMP, usuarios, entradas, salidas, interfaces, decisión respaldada y grado máximo de automatización. Es igualmente importante especificar lo que la IA no debe hacer.
Una herramienta que redacta un resumen de investigación de desviación para revisión de QA no es el mismo caso de uso que una herramienta que determina causa raíz, aprueba una decisión de disposición de lote o modifica un parámetro de control de proceso. Los últimos casos pueden tener mayor impacto, menor detectabilidad de las deficiencias y mucha menos tolerancia a la incertidumbre residual.
2. Aplicar QRM durante todo el ciclo de vida
La EMA pregunta explícitamente cómo debe aplicarse la gestión de riesgos para la calidad (QRM) durante todo el ciclo de vida de los modelos de IA en áreas GMP de alto riesgo, incluidas situaciones de alto impacto para el paciente y baja detectabilidad de deficiencias. La evaluación de riesgos debe ir más allá de una evaluación única de implantación.
| Etapa | Preguntas clave | Evidencia que conservar |
|---|---|---|
| Diseño y selección | ¿Qué tarea se apoya y qué errores son previsibles? | Uso previsto, evaluación de riesgos, evaluación del proveedor y arquitectura |
| Implantación | ¿Están controladas las entradas y restringidas las salidas? ¿Accede a registros GMP o ejecuta acciones? | Configuración, pruebas de interfaz y evidencia de control de acceso |
| Validación | ¿El sistema y sus controles detectan o previenen salidas inaceptables? | Protocolo, conjunto de desafío, pruebas de estrés y justificación de aceptación |
| Operación | ¿Quién revisa las salidas y cómo se escalan excepciones? | SOP, formación, audit trails, revisiones y gestión de desviaciones |
| Cambio y seguimiento | ¿Cómo se controlan actualizaciones, reentrenamiento, deriva y cambios de proveedor? | Control de cambios, tendencias, revisión periódica y justificación de revalidación |
3. Tratar las guardrails como controles que requieren evidencia
La EMA pregunta en qué medida las guardrails pueden prevenir, detectar o contener alucinaciones, recomendaciones incorrectas y datos fabricados, y qué evidencia justificaría depender de ellas. Una guardrail no queda validada simplemente porque figure en una demostración de producto o en documentación del proveedor.
Debe probarse frente a condiciones realistas: material fuente ambiguo, registros incompletos, información contradictoria, solicitudes prohibidas, entradas adversariales, volumen inesperado, dependencias no disponibles y debilidades conocidas del modelo. También debe definirse qué ocurre cuando no puede proporcionar una respuesta fiable: rechazar la petición, dirigirla a un revisor cualificado o detener una acción automatizada posterior pueden ser resultados seguros.
Los criterios de aceptación deben vincularse al riesgo GMP. Cuando una salida incorrecta pueda influir en una decisión crítica, el sistema no debe depender de que un usuario detecte cada error. El control debe hacer que el fallo sea detectable y contenible antes de que genere impacto GMP.
4. Hacer específica la supervisión humana
«Human in the loop» no es por sí solo una estrategia de control. La EMA pregunta qué nivel y forma de supervisión siguen siendo necesarios tras implantar guardrails, y si esa supervisión garantiza exactitud, trazabilidad y responsabilidad.
Un diseño defendible identifica el rol responsable de la revisión, la información necesaria para que sea significativa, el tiempo de respuesta permitido, las circunstancias que exigen escalado y el registro creado por la decisión. Los revisores necesitan acceso a los datos fuente relevantes, una forma de distinguir el contenido generado por IA de la evidencia verificada y formación sobre las limitaciones de la herramienta.
5. Controlar la evolución del modelo y la cadena de suministro
Las preguntas del taller plantean actualizaciones, reentrenamiento y deriva, además de cadenas de suministro de IA basadas en cloud donde la infraestructura de guardrails está fuera del control directo del fabricante. Estas cuestiones determinan si puede mantenerse el estado validado.
Los fabricantes deben definir qué cambios requieren evaluación antes de su implantación: versión del modelo base, prompt u orquestación, fuente de retrieval, guardrails, infraestructura, permisos de acceso e interfaces nuevas o modificadas. Si un proveedor no ofrece notificación adecuada, visibilidad del control de cambios o capacidad de auditoría, esa limitación debe influir en el uso previsto y en la decisión de riesgo.
Checklist operativa para equipos GMP
- Clasifique cada caso de uso por impacto GMP, detectabilidad del error y grado de autonomía.
- Redacte el uso previsto y límites explícitos de uso prohibido antes de configurar o probar.
- Mapee flujos de datos: fuentes, prompts, salidas, audit trails, retención y permisos.
- Identifique modos de fallo, incluidos alucinación, datos fabricados, recomendación incorrecta, deriva y cambio no autorizado.
- Defina guardrails y pruebe su eficacia en escenarios normales, límite y de fallo.
- Documente qué sucede cuando el sistema es incierto, no está disponible o queda fuera de condiciones validadas.
- Asigne roles responsables de revisión humana, derechos de decisión y rutas de escalado.
- Someta los cambios de modelo, configuración, fuente de conocimiento y proveedor a control de cambios formal.
- Establezca seguimiento continuo, revisión periódica y criterios de suspensión o retirada.
Qué no debe concluirse todavía
Sería prematuro afirmar que la EMA ha autorizado GenAI o LLM para aplicaciones GMP críticas, o que Annex 22 los permitirá con certeza si se utilizan guardrails. La página oficial del taller indica que la EMA está considerando las implicaciones de la consulta y recopilando aportaciones de expertos sobre salvaguardas y mitigaciones de riesgo. No deben asumirse expectativas, alcance o redacción finales a partir de las preguntas de consulta y del taller.
La hipótesis prudente de planificación es más limitada: cuando un fabricante proponga IA adaptativa, dinámica o probabilística para un propósito relevante para GMP, debe esperar escrutinio de la evidencia de validación, gestión del ciclo de vida, responsabilidad humana, Data Integrity, trazabilidad, control del proveedor y del punto en que el riesgo residual hace inadecuado el caso de uso.
FAQ
¿Es Annex 22 una guía GMP definitiva?
No. La página del evento de la EMA describe el desarrollo de la guía y un taller de expertos; no presenta un texto final de Annex 22 ni requisitos finalizados.
¿Puede utilizarse GenAI hoy en GMP?
La página del taller no ofrece una respuesta general de sí o no. Sus preguntas se centran en si, y bajo qué controles, los modelos dinámicos, adaptativos y probabilísticos podrían admitirse en aplicaciones GMP.
¿Bastan las guardrails para un caso de uso GMP crítico?
No debe asumirse. La EMA pregunta si las guardrails abordan suficientemente cuestiones de alto riesgo y si algunas decisiones críticas siguen siendo inadecuadas pese a guardrails y supervisión. El fabricante debe demostrar eficacia para su caso de uso específico.
Fuentes
- European Medicines Agency: Good manufacturing practice: Multistakeholder workshop on expert contributions to artificial intelligence guidance development (Annex 22)
- Comisión Europea: EudraLex Volume 4 — EU Guidelines for Good Manufacturing Practice
Para recibir análisis GMP prácticos, suscríbase a The Pragmatic GMP.