El harness multimodelo desplaza la evaluación del prompt al resultado
Orquestación, reintentos, caché y reconciliación de cambios explican una parte de la calidad que suele atribuirse al modelo.
- Fuerza
- Tecnología
- Horizonte
- Operativo
- Estado
- En consolidación
- Confianza
- Media
- Impacto
- Alto
- Prácticas
- Transversal
Qué observamos
La descripción publicada el 2 de septiembre de 2026 de una revisión de playbooks reconstruida como sistema multiagente atribuye mejoras a orquestación, contexto compartido y políticas de ejecución, con métricas propias y mayor latencia. La verificación independiente de ARC Prize del 3 de septiembre apunta en la misma dirección: sus dos filas para el mismo modelo en ARC-AGI-3 Semi-Private, 62,7 % y 99,9 %, difieren a la vez en harness y en configuración de esfuerzo, de modo que no cabe atribuir la diferencia a un solo factor.
Qué significa para una firma
Comparar modelos sin fijar el harness produce conclusiones no reproducibles. La unidad de evaluación útil es el producto completo en condiciones reales, con la carga humana incluida.
Qué decisión puede exigir
Construir un banco de pruebas por workflow que registre versión de modelo, harness, playbook, dataset y revisión humana.
Qué desconocemos
No consta réplica externa de esas métricas ni su comportamiento por jurisdicción o tipo de contrato.
Ámbito y limitaciones
Inferencia editorial sobre una publicación de proveedor con métricas autodeclaradas, contrastada con una evaluación externa en entornos abstractos que no aísla causalmente el harness.