PIC/S ha publicado “Draft guidelines: New annex 22 - Artificial intelligence” en la sección PIC/S GMP Guide de sus publicaciones. El propuesto Annex 22: Artificial Intelligence es un nuevo Annex, no una revisión de uno existente. Por tanto, constituye un desarrollo regulatorio importante para las organizaciones que utilizan, adquieren o evalúan sistemas informatizados habilitados con AI/ML en operaciones GMP.
El documento sigue siendo un proyecto. No debe tratarse como un requisito GMP definitivo e independientemente vinculante ni como evidencia de un calendario de implementación confirmado. Su importancia práctica reside en el nivel de especificidad que aporta a la gestión de modelos AI utilizados en aplicaciones GMP críticas, especialmente cuando los resultados pueden afectar directamente a la seguridad del paciente, la calidad del producto o la integridad de los datos.
El proyecto se posiciona explícitamente como orientación adicional al Annex 11 para sistemas informatizados en los que se integran modelos AI. Para los responsables sénior de calidad, validación, IT y fabricación, el mensaje central es claro: se propone que el aseguramiento de AI sea algo más que la CSV convencional aplicada a un algoritmo novedoso. Exige un control demostrable del uso previsto, los datos, el rendimiento del modelo, las funciones humanas y los cambios operativos durante todo el ciclo de vida del modelo.
Qué abarca el proyecto PIC/S
El alcance propuesto abarca sistemas informatizados utilizados en la fabricación de medicamentos y sustancias activas cuando se emplean modelos AI en aplicaciones críticas con impacto directo en la seguridad del paciente, la calidad del producto o la integridad de los datos. Los ejemplos indicados incluyen la predicción o clasificación de datos.
Se centra en modelos de machine learning cuya funcionalidad se obtiene mediante entrenamiento con datos en lugar de programación explícita. Un modelo puede comprender varios modelos individuales que automatizan etapas específicas de procesos GMP. Por ello, el proyecto puede ser relevante para una amplia variedad de casos de uso, incluida la inspección visual automatizada, la clasificación de datos de fabricación o de laboratorio y herramientas predictivas integradas en procesos de decisión GMP.
No obstante, el alcance se limita deliberadamente. El proyecto se aplica a modelos estáticos que no adaptan su rendimiento durante el uso mediante la incorporación de datos nuevos, y a modelos con resultados deterministas. Los modelos dinámicos que aprenden continua y automáticamente durante el uso, y los modelos probabilísticos que pueden proporcionar resultados diferentes para entradas idénticas, no están cubiertos y se declara que no son adecuados para aplicaciones GMP críticas.
El documento también indica que no se aplica a la AI generativa ni a los Large Language Models (LLM), y que tales modelos no deberían utilizarse en aplicaciones GMP críticas. Cuando se utilicen en aplicaciones GMP no críticas sin impacto directo en la seguridad del paciente, la calidad del producto o la integridad de los datos, el personal adecuadamente cualificado y formado deberá seguir siendo responsable de decidir si los resultados son adecuados para el uso previsto. Esta es una expectativa human-in-the-loop (HITL), no una aprobación general de la AI generativa en el trabajo GMP.
El modelo de control propuesto: uso previsto antes que tecnología
Annex 22 parte del principio GMP de que el uso previsto debe entenderse y definirse. La orientación propuesta espera una descripción detallada de la tarea que el modelo ayuda a realizar o automatiza, fundamentada en un conocimiento profundo del proceso en el que está integrado. También espera una caracterización exhaustiva de los datos de entrada, incluidas variaciones comunes y raras, limitaciones y entradas potencialmente erróneas o sesgadas.
Un experto en la materia del proceso (SME) debería ser responsable de la adecuación de esta descripción, que debería documentarse y aprobarse antes de que comiencen las pruebas de aceptación. Cuando corresponda, el espacio muestral de entrada debería dividirse en subgrupos. Estos pueden reflejar el resultado de la decisión, la línea base del centro o del equipo, las características del material o producto, o características específicas de la tarea, como el tipo y la gravedad del defecto.
Esto es significativo porque desplaza el debate más allá de afirmaciones genéricas de que un algoritmo es «exacto». El enfoque propuesto exige que las organizaciones definan para qué proceso, población, condiciones y casos límite es aceptable el modelo. Una métrica global de exactitud favorable puede ser inadecuada si los subgrupos críticos presentan un rendimiento deficiente.
Evidencia de validación: métricas, criterios de aceptación y datos de prueba independientes
El proyecto propone métricas dependientes del caso y alineadas con el uso previsto. Para un modelo de clasificación, los ejemplos incluyen una matriz de confusión, sensibilidad, especificidad, exactitud, precisión y puntuación F1. Los criterios de aceptación deberían establecerse y aprobarse antes de las pruebas, asignando la responsabilidad a un SME del proceso. Los criterios pueden diferir entre los subgrupos pertinentes.
Un principio propuesto especialmente importante es que los criterios de aceptación del modelo deberían ser, como mínimo, tan exigentes como el rendimiento del proceso al que sustituye. Esto hace indispensable una línea base robusta: una organización debería comprender el rendimiento del proceso manual o automatizado existente antes de afirmar que un modelo AI supone una sustitución aceptable.
Los requisitos propuestos para los datos de prueba son detallados. Los datos de prueba deberían representar y ampliar el espacio muestral completo del uso previsto; estar estratificados; incluir subgrupos pertinentes; y reflejar limitaciones, complejidad y variaciones comunes y raras. El tamaño del conjunto de datos debería permitir calcular las métricas de prueba con una confianza estadística adecuada. El etiquetado debería verificarse mediante un proceso que proporcione un grado muy elevado de corrección, potencialmente usando expertos independientes, equipos validados o ensayos de laboratorio.
La independencia de los datos de prueba también es un control destacado. El proyecto propone medidas técnicas y/o procedimentales para garantizar que los datos utilizados en las pruebas finales no se utilizaron durante el desarrollo, el entrenamiento o la validación del modelo. Cuando un conjunto de prueba se separa antes del entrenamiento, el personal implicado en desarrollo y entrenamiento no debería tener acceso a él. Los datos de prueba deberían protegerse mediante control de acceso y funcionalidades de audit trail, sin copias fuera del repositorio controlado. La orientación también aborda la independencia del personal e identifica el principio de cuatro ojos como una posible mitigación cuando no pueda mantenerse una separación completa.
Explicabilidad, confianza y operación
Para los modelos utilizados en aplicaciones GMP críticas, el proyecto propone capturar y registrar las características que contribuyeron a una clasificación o decisión durante las pruebas. Cuando corresponda, las técnicas de atribución de características, como los valores SHAP o LIME, y las herramientas visuales, como los mapas de calor, deberían destacar los factores clave que contribuyen a un resultado. La revisión de dichas características debería formar parte de la aprobación de los resultados de prueba, con un enfoque basado en el riesgo.
La propuesta también aborda las puntuaciones y los umbrales de confianza. Cuando corresponda, los modelos de predicción o clasificación deberían registrar las puntuaciones de confianza. Un modelo debería configurarse para que solo produzca un resultado cuando la confianza sea adecuada; para una confianza muy baja, un resultado «indeciso» puede ser más apropiado que una predicción o clasificación no fiable.
Una vez desplegados, el modelo, el sistema informatizado y el proceso asistido o automatizado deberían estar sujetos a control de cambios. Los cambios en el modelo, el sistema, el proceso o los objetos físicos de entrada pertinentes deberían evaluarse para determinar la necesidad de repetir las pruebas. El proyecto también propone control de configuración, detección de cambios no autorizados, monitorización periódica del rendimiento y monitorización de que los datos de entrada permanezcan dentro del espacio muestral y el uso previsto definidos. Este último punto es directamente relevante para la deriva de datos y los cambios ambientales o de proceso, como cambios en las condiciones de iluminación en una aplicación de inspección.
Recomendación GuideGxP: prepararse ahora, sin sobrestimar el proyecto
Las organizaciones no necesitan esperar a un Annex 22 definitivo para establecer una base defendible de gobernanza de AI. La acción adecuada no es etiquetar retrospectivamente como AI todas las herramientas analíticas avanzadas ni introducir una «política de AI» no estructurada. En su lugar, deben realizar una evaluación focalizada y basada en el riesgo de los sistemas que utilizan modelos entrenados y que pueden influir en decisiones GMP o datos críticos.
| Área de preparación | Recomendación práctica de GuideGxP |
|---|---|
| Inventario de casos de uso | Identificar modelos AI/ML en procesos GMP, incluidas las funcionalidades proporcionadas por proveedores, y clasificar si sus resultados tienen impacto directo en la seguridad del paciente, la calidad del producto o la integridad de los datos. |
| Uso previsto | Establecer declaraciones aprobadas de uso previsto, límites de decisión, espacio muestral de entrada, limitaciones conocidas, modos de fallo y SME del proceso responsables. |
| Gobernanza de datos | Mapear los conjuntos de datos de entrenamiento, validación y prueba; preservar la procedencia, la justificación del etiquetado, el control de acceso, los audit trails, la independencia y la conservación. |
| Estrategia de validación | Definir métricas apropiadas al riesgo y criterios de aceptación por subgrupo antes de las pruebas finales; documentar la línea base de rendimiento de cualquier proceso sustituido. |
| Control operativo | Someter el modelo, su configuración, sus interfaces y el proceso asociado a control de cambios; definir la monitorización del rendimiento, la deriva y los límites de entrada. |
| Supervisión humana | Especificar la responsabilidad de decisión del operador y la evidencia de formación y rendimiento consistente allí donde se utilice HITL. |
QA debería garantizar que la responsabilidad no esté fragmentada entre ciencia de datos, IT/CSV, fabricación y proveedores. El proyecto espera una estrecha cooperación entre las partes pertinentes durante la selección del algoritmo, el entrenamiento, la validación, las pruebas y la operación, junto con cualificaciones adecuadas, responsabilidades definidas y acceso apropiado. Se espera que el usuario regulado disponga de la documentación pertinente y la revise, incluso cuando un proveedor o prestador de servicios realice el entrenamiento, la validación o las pruebas.
Conclusión clave: el propuesto Annex 22 es un marco focalizado para demostrar que un modelo AI/ML crítico es apto para su uso GMP definido, se ha probado de forma independiente, es explicable en un grado adecuado, se controla durante la operación y se monitoriza frente a la deriva.
Qué vigilar a continuación
La página de publicaciones de PIC/S presenta actualmente “Draft guidelines: New annex 22 - Artificial intelligence” como documento de proyecto dentro de la PIC/S GMP Guide. Las organizaciones deberían seguir las comunicaciones de PIC/S sobre consulta, revisión, finalización y cualquier información de implementación asociada. Hasta entonces, el trabajo interno de preparación debería gestionarse a través de los marcos existentes de PQS, QRM, gestión de proveedores, CSV, integridad de datos y control de cambios, distinguiendo claramente las obligaciones GMP actuales de las medidas adoptadas en anticipación del proyecto.