Gobernanza, evaluación e IA empresarial8 min de lectura

Evaluar la IA desde dentro: el nuevo experimento de Anthropic y Accenture

Anthropic permitirá que evaluadores independientes trabajen junto a sus equipos durante el desarrollo de modelos. La iniciativa puede elevar la transparencia del sector, aunque todavía debe demostrar cómo protege su independencia y cómo comunicará sus hallazgos.

El 18 de septiembre, Anthropic anunció una alianza con Faculty, la división especializada en IA de Accenture, para incorporar evaluadores independientes a su proceso de desarrollo. Estos profesionales tendrán un acceso comparable al de un empleado y participarán en evaluación de modelos, red teaming, análisis de alineamiento y comprobación de salvaguardas.

Las dos compañías prevén invertir al menos 1.000 millones de dólares cada una durante los próximos cinco años para crear capacidad de evaluación. El acuerdo no es exclusivo y Anthropic afirma que trabaja con otras organizaciones. También reconoce dos limitaciones importantes: todavía no existen estándares comunes para el acceso o la publicación de resultados y, al menos en esta fase, la propia Anthropic financiará directamente el trabajo de Accenture.

01

De la auditoría final a la observación continua

Las evaluaciones externas suelen recibir una versión casi terminada del modelo, un conjunto de escenarios y un plazo limitado. Ese enfoque puede detectar fallos, pero llega tarde para observar cómo se tomaron las decisiones de entrenamiento, qué riesgos se descartaron o cómo cambiaron las salvaguardas durante el desarrollo.

El modelo integrado propone otra posición: acompañar la construcción desde dentro, seguir la evolución del sistema y conversar directamente con quienes toman decisiones. En teoría, esta proximidad permite descubrir problemas antes de que se conviertan en características estructurales o lleguen a producción.

La diferencia clave

Una evaluación puntual pregunta si una versión supera unas pruebas. Una evaluación continua también pregunta por qué se eligieron esas pruebas, qué quedó fuera y cómo respondió la organización cuando apareció un riesgo.

02

Independencia no significa distancia absoluta

El acceso interno puede mejorar la calidad de la evidencia y, al mismo tiempo, crear dependencia. Quien trabaja cerca del equipo entiende mejor el sistema, pero también puede adoptar sus prioridades, lenguaje y supuestos. El hecho de que el fabricante financie la evaluación añade otra tensión evidente.

La credibilidad dependerá de reglas que el anuncio todavía no concreta: libertad para elegir qué se examina, capacidad de escalar desacuerdos, protección contractual frente a represalias, publicación de limitaciones y mecanismos para resolver conflictos de interés. La independencia será una propiedad del diseño institucional, no una etiqueta del proveedor.

Anthropic sostiene que estos evaluadores podrán informar sobre incidentes y ofrecer una visión pública mejor fundamentada. La utilidad real de esa promesa se medirá por la frecuencia, el detalle y la oportunidad de esos informes, además de por la posibilidad de explicar qué información no pudo publicarse.

03

Qué cambia para las empresas que compran IA

Las organizaciones no necesitan replicar un programa de miles de millones para aplicar la misma lógica. Un contrato, una automatización o un agente pueden evaluarse con separación de funciones: quien diseña el flujo, quien lo aprueba y quien comprueba sus resultados no deberían ser siempre la misma persona o el mismo proveedor.

El marco de gestión de riesgos de NIST ya articula este trabajo alrededor de gobernar, contextualizar, medir y gestionar. La novedad del acuerdo es llevar la evaluación más cerca del desarrollo y darle continuidad. Para una empresa, eso se traduce en pruebas vinculadas al uso real, registros de cambios, criterios de parada y responsables claros.

También cambia la conversación de compra. La precisión media o el rendimiento en un benchmark cuentan poco si no se conoce el comportamiento en documentos propios, idiomas reales, excepciones operativas y acciones con consecuencias. La evaluación empresarial necesita medir el sistema completo: modelo, datos, herramientas, permisos, interfaz y supervisión humana.

04

Automatización, audio y eventos: medir el flujo, no solo el modelo

En transcripción, una tasa de error agregada no revela si se confunden nombres, cifras, turnos de palabra o términos técnicos. En un evento, esos fallos pueden contaminar subtítulos, actas y tareas posteriores. Una evaluación útil separa condiciones acústicas, idiomas, solapamiento de voces y latencia, y comprueba cómo se corrigen los resultados antes de publicarse.

En automatización, el criterio tampoco termina en la calidad del texto. Un agente puede redactar correctamente y aun así usar la cuenta equivocada, acceder a datos innecesarios o ejecutar una acción sin aprobación. Los equipos deberían considerar escenarios adversos, trazabilidad, reversibilidad y límites de permisos como parte de la calidad del producto.

Para las pymes, la proporcionalidad es esencial. Los controles pueden concentrarse en los procesos con mayor impacto: comunicaciones externas, información personal, pagos, contratos, cambios de sistemas y decisiones que afectan a terceros. El objetivo no es evaluar todo con la misma intensidad, sino relacionar el esfuerzo con el riesgo.

05

Lo que todavía falta por demostrar

El anuncio es relevante porque reconoce que la autoevaluación de los laboratorios no basta. Sin embargo, no constituye por sí mismo una garantía. Aún faltan estándares compartidos, modelos de financiación menos dependientes del evaluado y acuerdos sobre la información que debe hacerse pública.

Tampoco está claro cómo se resolverán los desacuerdos entre evaluador y laboratorio, qué acceso recibirán reguladores o investigadores y si los hallazgos críticos podrán retrasar un lanzamiento. Esas decisiones separarán un mecanismo de control con autoridad de una capa adicional de comunicación corporativa.

Conclusión

La evaluación empieza a convertirse en infraestructura, no en una revisión de última hora.

La alianza entre Anthropic y Accenture abre un experimento valioso: introducir una mirada independiente mientras el modelo todavía está tomando forma. Su éxito dependerá menos del volumen de inversión que de reglas verificables sobre acceso, conflicto de interés, publicación y capacidad de influir en decisiones reales.

Cinco preguntas para una evaluación creíble

  • Alcance. ¿Puede el evaluador decidir qué sistemas, datos y escenarios examina?
  • Independencia. ¿Cómo se gestionan la financiación y los conflictos de interés?
  • Evidencia. ¿Las conclusiones se apoyan en pruebas reproducibles y usos reales?
  • Consecuencias. ¿Un hallazgo crítico puede cambiar o detener un despliegue?
  • Transparencia. ¿Qué resultados, límites e incidentes conocerán clientes y público?

Fuentes

Información comprobada en el anuncio oficial de Anthropic del 18 de septiembre de 2026 y en los recursos de evaluación y gestión de riesgos del NIST.