Dossier · agosto y septiembre 2026
El momento agéntico: capacidad, especialización y economía
La aceleración relevante está en la convergencia entre modelos más capaces, sistemas especializados e infraestructura económica para ejecutar trabajo. Justifica revisar decisiones ahora; no acredita por sí sola la llegada de la AGI.
- Hechos contrastados
- Inferencia editorial
- Escenarios refutables
Revisión: 2026-09-05 · Fecha de corte editorial: 5 de septiembre de 2026. Todo lo posterior a esa fecha no está recogido aquí.
Revisión: 5 de septiembre de 2026. Los anuncios no certifican AGI; disponibilidad, condiciones y prestaciones pueden cambiar. 800/1600 siguen siendo lentes, no predicciones.
Contenido
- Veredicto ejecutivo
- Cinco hechos, con fecha y fuente
- Tres niveles, no una sola singularidad
- Qué no está demostrado
- El ciclo de amplificación
- Capacidad: qué cambia en el trabajo
- Coste: la economía del contexto no es la economía del asunto
- Control: elegibilidad antes que capacidad
- Cinco compromisos que no son el mismo compromiso
- Cómo leer las cifras
- Un salto medido no es una declaración de AGI
- ¿Singularidad o compresión del tiempo de decisión?
- Seis matices de arquitectura
- Siete umbrales, revisados
- Tres escenarios refutables
- Comprar, asociarse, construir y controlar no son alternativas excluyentes
- Partnership y resultado
- Seis decisiones en 90 días
- Alcance, cambios y cierre
Veredicto ejecutivo
La competencia se desplaza a configuraciones completas y a derechos de control, no únicamente a la mejor respuesta de un modelo. Lo que decide el resultado es el conjunto de modelo, harness, herramientas, corpus autorizado, criterios de aceptación y revisión humana, junto con las condiciones contractuales bajo las que ese conjunto puede utilizarse en un asunto real.
De ahí se sigue un requisito de diseño. Una arquitectura común debe admitir especialización sin perder gobierno, evidencia y capacidad de sustitución. Si adoptar un modelo especializado obliga a ceder el conocimiento, la telemetría o la evaluación, la mejora de capacidad se compra con una pérdida de control que no aparece en la factura.
La frontera puede avanzar en días. Las decisiones de una firma no deberían quedar inmovilizadas durante años. Marco editorial, no velocidad medida
Cinco hechos, con fecha y fuente
Cinco publicaciones entre el 19 de agosto y el 3 de septiembre de 2026. Los cinco hechos se apoyan en anuncios de las partes. La evaluación externa de ARC Prize se distingue y analiza por separado. Esa evaluación se recoge más abajo, en el apartado «Un salto medido no es una declaración de AGI».
19 de agosto. Stripe anuncia un acuerdo para adquirir OpenRouter, plataforma de acceso y enrutado entre modelos. OpenRouter publica su propia nota el mismo día, declara continuidad de nombre, producto y hoja de ruta, y el comunicado somete la operación a las condiciones de cierre habituales.
Fuente declarada: Stripe · OpenRouter · Stripe agrees to acquire OpenRouter to help businesses optimize token routing and usage (se abre en una pestaña nueva) · OpenRouter is Joining Stripe (se abre en una pestaña nueva)
20 de agosto. Harvey publica Tenet como research preview: un modelo basado en Kimi K3, postentrenado con Fireworks para trabajo jurídico de largo recorrido. Declara datos públicos, sintéticos y de expertos, y declara expresamente no haber utilizado datos de clientes.
Fuente declarada: Harvey · Fireworks AI · Post-training update: Harvey Tenet Research Preview (se abre en una pestaña nueva) · Post-training Kimi K3 with Harvey for long-horizon legal work (se abre en una pestaña nueva)
1 de septiembre. Anthropic presenta Claude Fable 5.1 y Claude Mythos 5.1, descritos como el mismo modelo subyacente con salvaguardas y acceso distintos. El ahorro estimado se atribuye a la reducción del precio de lectura de caché, no a una rebaja equivalente de todas las tarifas.
Fuente declarada: Anthropic · Introducing Claude Fable 5.1 and Claude Mythos 5.1 (se abre en una pestaña nueva)
1 de septiembre. Anthropic anuncia Enterprise Frontier Safeguards: datos de actividad en infraestructura cloud del propio cliente, con sus claves, políticas y registros, y señales de monitorización dirigidas a su equipo. El almacenamiento en cloud del cliente, las claves gestionadas por el cliente y la revisión plenamente automatizada se describen como opciones que el cliente activa, no como configuraciones universales; el despliegue por fases se anuncia para más adelante en otoño y los clientes elegibles reciben mientras tanto una retención cero transitoria.
Fuente declarada: Anthropic · Developing Enterprise Frontier Safeguards with our customers (se abre en una pestaña nueva)
3 de septiembre. OpenAI anuncia GPT-6 Astra para trabajo profesional, programación y uso de ordenador, con despliegue inicial limitado y ampliación posterior, y publica una ficha de seguridad específica. Estado observado el 5 de septiembre: existe documentación de API para el modelo y un artículo de ayuda que describe su llegada a planes elegibles. Documentación disponible no equivale a acceso garantizado para cada cuenta, región o contrato.
Fuente declarada: OpenAI (anuncio, 3 septiembre; documentación consultada el 5 de septiembre) · GPT-6 Astra: A new generation of intelligence (se abre en una pestaña nueva) · Safety overview: GPT-6 Astra (se abre en una pestaña nueva) · API docs: GPT-6 Astra (se abre en una pestaña nueva) · GPT-5.6 and GPT-6 Pro in ChatGPT (se abre en una pestaña nueva)
Tres niveles, no una sola singularidad
Mezclar estos tres planos es la causa habitual de que un anuncio se lea como una prueba de algo que no demuestra.
- Primer nivel, hecho observado: avance de capacidades medido bajo condiciones concretas de modelo, harness, esfuerzo y entorno. Es lo único que las publicaciones acreditan directamente.
- Segundo nivel, inferencia editorial: una reorganización industrial que se deduce al combinar ejecución, distribución y economía. Es plausible y es una lectura del Observatorio, no un dato.
- Tercer nivel, hipótesis abierta: AGI o auto-mejora general sostenida. Requiere evidencia adicional que ninguna de estas fuentes aporta.
- El Observatorio no puntúa la proximidad a la AGI ni dibuja una fecha. Ausencia de prueba tampoco equivale a negar la posibilidad.
Qué no está demostrado
La distancia entre anuncio y capacidad utilizable en una firma es la parte que casi nunca se comunica.
- Un anuncio de acuerdo no es una operación consumada. La adquisición anunciada el 19 de agosto quedaba sujeta a condiciones de cierre; titular que la compra se ha cerrado sería incorrecto.
- Un research preview no es un producto disponible. No consta checkpoint público, licencia, condiciones de alojamiento ni oferta comercial verificada.
- Una métrica de proveedor no es un benchmark independiente. Depende del harness, del dataset y de la rúbrica empleados, y no es comparable entre productos. Tampoco procede agregar cifras de estudios distintos del mismo proveedor, como los de razonamiento sobre documentos, operaciones, tablas de revisión o conocimiento de firma, como si todos midieran el mismo checkpoint de Tenet sobre Kimi K3: cada estudio declara su propia configuración.
- Un despliegue escalonado no es disponibilidad general. Que exista documentación de API o un artículo de ayuda acredita que el modelo se está desplegando, no que cualquier cuenta, región o contrato pueda usarlo; y afirmar hoy que no está disponible para nadie sería igual de inexacto.
- Un roadmap de salvaguardas no es un control ya operativo. Anunciar un despliegue por fases no equivale a una exención activada para todos los clientes, modelos y rutas.
- Ninguno de estos anuncios acredita inteligencia artificial general. Ni los benchmarks ni una adquisición constituyen prueba de ello.
El ciclo de amplificación
Escenario, no hecho. Es un modelo de lectura del Observatorio y se ofrece con sus condiciones de refutación.
La IA ayuda a construir herramientas, conectores y pruebas. Esos activos permiten ejecutar más trabajo. La ejecución aporta información para evaluar y mejorar los sistemas. Y esa evaluación acelera la construcción de nuevas capacidades.
Cada transición del ciclo tiene un freno real: derechos sobre los datos, intervención humana necesaria, medición fuera de muestra, calidad y seguridad de lo generado, recursos disponibles y cambios organizativos. El ciclo no prueba auto-mejora ilimitada y no debe representarse como tal.
Capacidad: qué cambia en el trabajo
Los tres elementos que se mueven a la vez son el trabajo prolongado sin pérdida de hilo, el uso de herramientas y ordenador, y la ejecución multipaso coordinada entre varios agentes. Los proveedores describen mayor capacidad para combinar esas tres cosas. El alcance fiable debe comprobarse por workflow y jurisdicción.
Los resultados publicados corresponden al conjunto de modelo y harness; estas publicaciones no aíslan experimentalmente toda contribución. El harness abarca cómo se reparte el trabajo, qué contexto comparte cada agente, cómo se reconcilian cambios incompatibles y cuándo se repite solo una subtarea. Atribuir todo al modelo lleva a decisiones de compra equivocadas.
La latencia puede aumentar cuando se coordina más ejecución. Es un recordatorio útil: la métrica que importa a una firma es el resultado aceptado con la carga de revisión incluida, no la velocidad de una respuesta aislada.
Coste: la economía del contexto no es la economía del asunto
La reducción del precio de lectura de caché abarata un componente concreto: releer repetidamente el mismo material dentro de una ejecución. Una revisión que consulta cien veces el mismo expediente tiene una economía distinta de una consulta breve. Eso no es un ahorro total del trabajo jurídico.
El coste completo de un workflow incluye la inferencia de cada paso, las herramientas invocadas, los reintentos, la orquestación, el almacenamiento, la evaluación continua y, sobre todo, el tiempo humano de verificación. El ahorro de tokens puede ser real aunque la revisión humana no cambie; su importancia debe medirse dentro del coste completo por resultado aceptado.
Si el enrutado entre modelos pasa a estar junto a la facturación por uso, la información económica de cada ejecución se concentra en el canal. Una firma que no mide su propio coste por resultado queda dependiendo de la contabilidad de su intermediario.
- Medir coste por resultado aceptado y por workflow, no coste por token ni por licencia.
- Incluir la carga humana de verificación en cada medición; sin ella, la comparación entre modelos no es informativa.
- Registrar la mezcla de modelos utilizada en cada workflow, para que un cambio de precios sea evaluable y no sorprenda en factura.
Control: elegibilidad antes que capacidad
Un modelo que no cumple las condiciones para procesar un asunto no es elegible para ese uso, aunque pueda servir para otras tareas con datos públicos. La secuencia correcta es primero canal, dato, residencia, retención y acceso; después rendimiento.
No-training, no-retention, residencia y custodia son compromisos distintos y con frecuencia se confunden en uno solo. Los anuncios de septiembre lo hacen visible: un mismo modelo base puede ofrecerse con condiciones diferentes según el producto y el canal, y una exención temporal durante un despliegue no es un régimen permanente ni generalizable a cualquier cliente.
El otro elemento de control es la evidencia. Si la cadena de razonamiento se vuelve menos legible, la supervisión no puede consistir en leer una explicación plausible. Debe apoyarse en el registro de acciones autorizadas, las fuentes consultadas, el estado de los sistemas tocados y los criterios de aceptación aplicados. La propia monitorización trata información sensible: el audit trail no debe convertirse en un duplicado indiscriminado de expedientes.
- Construir una matriz de modelo por canal, tipo de dato, residencia, retención y acceso, y mantenerla viva.
- Pilotar sin información de asuntos hasta que exista aprobación formal documentada.
- Recertificar workflows y herramientas al cambiar de versión: un modelo nuevo no hereda los permisos del anterior.
Cinco compromisos que no son el mismo compromiso
Marco del Observatorio, no asesoramiento de conformidad ni aprobación de ningún proveedor. La matriz sirve para no aceptar un compromiso como si acreditara los otros cuatro.
- El coste tampoco es neutro: el proveedor no cobra por la salvaguarda, pero la infraestructura del cliente sí factura almacenamiento, lecturas, escrituras y salida de datos.
- Custodiar el registro en casa mejora el control sobre la evidencia y no cambia por sí solo el comportamiento del modelo, el precio de la API ni los límites de uso.
| Compromiso | Qué acredita si se cumple | Qué documento o control exigir |
|---|---|---|
| No entrenamiento Introducing Claude Fable 5.1 and Claude Mythos 5.1 (se abre en una pestaña nueva) | Que el contenido enviado no alimenta el entrenamiento del modelo en esa ruta concreta | Cláusula por producto y canal, con excepciones declaradas y fecha de vigencia |
| Retención cero o limitada Developing Enterprise Frontier Safeguards with our customers (se abre en una pestaña nueva) | Cuánto tiempo persiste el contenido y con qué finalidad, no dónde se procesa | Política de retención por ruta, incluidas exenciones transitorias y su fecha de fin |
| Residencia del procesamiento Developing Enterprise Frontier Safeguards with our customers (se abre en una pestaña nueva) | Dónde se ejecuta la inferencia y qué subproveedores intervienen | Declaración de región de inferencia y de subencargados; almacenar registros en la Unión Europea no acredita que la inferencia ocurra allí |
| Custodia de la evidencia Developing Enterprise Frontier Safeguards with our customers (se abre en una pestaña nueva) | Quién guarda los registros de actividad y monitorización, con qué claves y con qué acceso | Titularidad del almacenamiento, gestión de claves, permisos de lectura y coste de almacenamiento, lecturas, escrituras y salida de datos, que corre a cargo del cliente |
| Revisión humana Developing Enterprise Frontier Safeguards with our customers (se abre en una pestaña nueva) | Si personas del proveedor pueden leer contenido y en qué supuestos | Supuestos de acceso humano, revisión automatizada disponible como opción y procedimiento de notificación al cliente |
Cómo leer las cifras
Sin semáforos de aprobado y sin ranking cruzado entre productos. Cada fila indica qué mide la cifra y qué no permite concluir.
| Cifra publicada | Qué mide | Qué no permite concluir |
|---|---|---|
| LAB: 10,8 % del modelo base frente a 19,7 % all-pass del postentrenado Post-training Kimi K3 with Harvey for long-horizon legal work (se abre en una pestaña nueva) | Cumplimiento de todos los criterios de un entregable en una evaluación descrita por las partes participantes, con juez LLM | No es precisión jurídica general ni validación independiente; all-pass y criterios parciales no son la misma medida |
| ARC-AGI-3 Semi-Private: 62,7 % con harness estándar a esfuerzo máximo y 99,9 % con adaptador de proveedor a esfuerzo alto OpenAI's GPT-6 Astra on ARC-AGI-3 (se abre en una pestaña nueva) | Generalización en entornos abstractos interactivos bajo dos configuraciones distintas del mismo modelo | No es prueba jurídica ni comparación causal controlada: cambian a la vez el harness y el esfuerzo |
| Fable 5.1: ahorro estimado por lectura de caché Introducing Claude Fable 5.1 and Claude Mythos 5.1 (se abre en una pestaña nueva) | El precio de releer contexto ya almacenado dentro de una ejecución | No es el coste íntegro por tarea ni una rebaja de todas las tarifas; son afirmaciones del proveedor |
| Enterprise Frontier Safeguards: despliegue por fases y elegibilidad Developing Enterprise Frontier Safeguards with our customers (se abre en una pestaña nueva) | Un compromiso anunciado de custodia de datos de monitorización en infraestructura del cliente | No es disponibilidad general ni una exención universal ya activada para todos los clientes y rutas |
Un salto medido no es una declaración de AGI
Existe una evaluación independiente de la nueva generación de modelos. Publicada por ARC Prize el 3 de septiembre de 2026, permite equilibrar la lectura y, a la vez, fija sus propios límites.
En ARC-AGI-3 Semi-Private, ARC Prize publica para GPT-6 Astra un 62,7 % con harness estándar a esfuerzo máximo y un 99,9 % con adaptador de proveedor a esfuerzo alto. Entre ambas filas cambian dos cosas a la vez, el harness y la configuración de esfuerzo, de modo que no es una comparación causal controlada y no cabe atribuir toda la diferencia al harness.
Fuente declarada: ARC Prize, 3 septiembre 2026 · OpenAI's GPT-6 Astra on ARC-AGI-3 (se abre en una pestaña nueva)
Los evaluadores describen un salto significativo de generalización en entornos abstractos interactivos y declaran expresamente que saturar esta evaluación no probaría inteligencia artificial general.
Fuente declarada: ARC Prize, artículo firmado por Greg Kamradt · OpenAI's GPT-6 Astra on ARC-AGI-3 (se abre en una pestaña nueva)
El conjunto de resultados verificados lleva fecha del 2 de septiembre de 2026 y recoge doce configuraciones del mismo modelo; el artículo que los comenta es del día 3. Son dos piezas con fechas distintas y conviene no igualarlas.
Fuente declarada: ARC Prize (resultados verificados) · Verified results: OpenAI GPT-6 Astra (se abre en una pestaña nueva)
La hoja de resultados de Claude Fable 5.1, del 1 de septiembre de 2026, recoge marcas en ARC-AGI-1 y ARC-AGI-2 y deja la columna de ARC-AGI-3 sin puntuación, que es ausencia de dato y no un cero. No procede comparar esas cifras con el resultado de Astra en ARC-AGI-3 ni ordenar modelos por inteligencia.
Fuente declarada: ARC Prize (hoja de resultados de Claude Fable 5.1) · Verified results: Anthropic Claude Fable 5.1 (se abre en una pestaña nueva)
- Es una evaluación independiente relevante, y conviene decirlo con precisión: lo que no está acreditado es una validación independiente sobre los workflows jurídicos y las jurisdicciones concretas de una firma. Afirmar que no existe ninguna evaluación externa sería inexacto.
- Un resultado en entornos abstractos interactivos no es un ensayo jurídico ni una garantía de fiabilidad general en producción.
- La lectura útil para una firma no es la puntuación, sino que el harness y la configuración explican una parte material del resultado. Comparar las dos mejores filas no aísla la contribución del harness, porque el esfuerzo también cambia.
- El horizonte temporal de un benchmark estima dificultad a partir del tiempo que tardaría una persona. No equivale a la duración de una sesión desatendida ni a una autorización profesional.
- Nota de método: estas cifras se han contrastado sobre el texto publicado en el dominio del evaluador, consultado el 5 de septiembre de 2026, no mediante réplica del experimento. Que una descarga automática falle no significa que la página no exista: la accesibilidad automática y la comprobación editorial son cosas distintas.
¿Singularidad o compresión del tiempo de decisión?
Interpretación del Observatorio. Hipótesis estratégica, no anuncio de AGI.
Estas noticias no acreditan por sí solas una singularidad tecnológica ni resuelven la definición de AGI. Sí permiten formular una hipótesis de trabajo: si sistemas más capaces pueden construir parte del software que necesitan, reutilizar contexto y ejecutar procesos con menor fricción, el tiempo entre una capacidad técnica y su incorporación a un servicio puede acortarse. La decisión institucional podría convertirse en el tramo más lento de la cadena.
El Observatorio llama a esto una posible discontinuidad operativa, no una singularidad demostrada. Hay que separar cuatro preguntas: qué puede hacer un sistema en una evaluación; qué hace de forma fiable en un workflow; bajo qué condiciones puede desplegarse; y qué autoridad puede delegarse. Una respuesta afirmativa a la primera no resuelve las otras tres.
El bucle a vigilar es capacidad, construcción de herramientas, procesos más amplios y evaluación y aprendizaje institucional. No debe representarse como auto-mejora autónoma ilimitada. Cada transición depende de acceso, datos, experimentación, control y personas. No hace falta esperar a una etiqueta AGI para actuar.
El efecto para la firma puede ser doble: sus equipos pueden construir servicios antes inviables y sus clientes pueden resolver resultados antes externalizados. Una ganancia técnica se convierte en transformación institucional solo si cambia la asignación del trabajo, el servicio, el precio o la capacidad de decisión.
La frontera puede avanzar en días. Las decisiones de una firma no deberían quedar inmovilizadas durante años. Marco editorial, no velocidad medida
Seis matices de arquitectura
Cada matiz contrapone una simplificación que el Observatorio evita y la formulación que considera precisa. La simplificación no se atribuye a nadie: es la lectura corriente que conviene corregir.
Conocimiento
- Simplificación que evitamos
- El conocimiento de la firma vive en el modelo que se contrata.
- Formulación precisa
- La memoria institucional no debe depender de un modelo. Si pesos, adaptadores o memorias incorporan conocimiento, deben gobernarse como activos derivados.
Procedencia, derechos, segregación, vigencia y retirada. El modelo no sustituye a la fuente ni al expediente, y el conocimiento histórico no se convierte automáticamente en un activo entrenable.
Decisión: Inventariar corpus, índices, cachés, memorias, adaptadores y datasets, con dueño y condiciones de retirada.
Fuente declarada: Harvey · Fireworks AI · Post-training update: Harvey Tenet Research Preview (se abre en una pestaña nueva) · Post-training Kimi K3 with Harvey for long-horizon legal work (se abre en una pestaña nueva)
Portabilidad
- Simplificación que evitamos
- Si la arquitectura es modular, cambiar de modelo es una operación neutra.
- Formulación precisa
- Los contratos y activos institucionales permanecen; la nueva configuración debe volver a superar las evaluaciones.
Formatos, uso de herramientas, estado, idiomas, citas, seguridad, coste y latencia cambian con la versión. Se homologa modelo más harness, nunca solo un identificador.
Decisión: Prohibir la migración silenciosa: cada cambio pasa por la suite de regresión.
Fuente declarada: ARC Prize · Anthropic (guía de migración) · OpenAI's GPT-6 Astra on ARC-AGI-3 (se abre en una pestaña nueva) · Migration vers Claude Fable 5.1 et Claude Mythos 5.1 (se abre en una pestaña nueva)
Enrutado
- Simplificación que evitamos
- Con acceso a muchos modelos desaparece el riesgo de dependencia.
- Formulación precisa
- Varios modelos diversifican una capa; el gateway puede concentrar otras dependencias.
Autenticación, políticas, trazas, observabilidad, fallbacks y facturación pueden quedar en un único intermediario. El modelo anunciado, el solicitado y el realmente servido no son necesariamente el mismo.
Decisión: Exigir proveedor efectivo declarado, políticas y trazas exportables y una alternativa probada.
Fuente declarada: Stripe · OpenRouter · Stripe agrees to acquire OpenRouter to help businesses optimize token routing and usage (se abre en una pestaña nueva) · OpenRouter is Joining Stripe (se abre en una pestaña nueva)
Gobierno
- Simplificación que evitamos
- Se elige el modelo más potente y después se comprueba si es admisible.
- Formulación precisa
- Entre las rutas autorizadas, elegir la que alcanza el resultado requerido con calidad, tiempo y coste aceptables.
Secreto, finalidad, residencia y mandato son restricciones, no variables intercambiables por ahorro. Un fallback no relaja la confidencialidad.
Decisión: Bloquear o escalar cuando ninguna ruta sea admisible, en lugar de degradar la condición.
Fuente declarada: Anthropic (EFS) · OpenAI (ficha de seguridad) · Developing Enterprise Frontier Safeguards with our customers (se abre en una pestaña nueva) · Safety overview: GPT-6 Astra (se abre en una pestaña nueva)
Harness
- Simplificación que evitamos
- Un segundo modelo que revisa al primero elimina el error.
- Formulación precisa
- La revisión multimodelo es un control posible; necesita evidencia de valor incremental y no elimina errores correlacionados.
Conviene combinar fuentes, esquemas, reglas, invariantes y revisión humana, y apoyarse en evidencia de acciones y resultados en lugar de confiar solo en las explicaciones del propio sistema.
Decisión: Medir el valor incremental de cada control antes de darlo por bueno; registrar los fallos que sí escapan.
Fuente declarada: OpenAI (ficha de seguridad) · ARC Prize · Safety overview: GPT-6 Astra (se abre en una pestaña nueva) · OpenAI's GPT-6 Astra on ARC-AGI-3 (se abre en una pestaña nueva)
Economía
- Simplificación que evitamos
- Un token más barato es un servicio más barato.
- Formulación precisa
- La economía se mide por resultado aceptado, incluido el trabajo necesario para corregirlo y responder por él.
Inferencia, almacenamiento, herramientas, reintentos, validación y revisión humana forman el coste. Un presupuesto de gasto no es un poder para comprometer a la firma.
Decisión: Separar presupuesto de inferencia y autoridad para actos externos, y medir el coste neto por servicio.
Fuente declarada: Stripe · Anthropic · Stripe agrees to acquire OpenRouter to help businesses optimize token routing and usage (se abre en una pestaña nueva) · Introducing Claude Fable 5.1 and Claude Mythos 5.1 (se abre en una pestaña nueva)
Siete umbrales, revisados
Ninguno se marca como superado por un anuncio. Cada uno indica qué evidencia haría falta y qué decisión desencadena.
Horizonte autónomo
Evidencia requerida: casos nuevos, tasa de aceptación, número de intervenciones y configuración registrada. Decisión: revisar la supervisión solo tras una evaluación por acción y riesgo, manteniendo aprobación humana en salidas externas.
Fuente declarada: METR · OpenAI · Anthropic · Clarifying limitations of time horizon (se abre en una pestaña nueva) · GPT-6 Astra: A new generation of intelligence (se abre en una pestaña nueva) · Introducing Claude Fable 5.1 and Claude Mythos 5.1 (se abre en una pestaña nueva)
Transferencia entre dominios
Evidencia requerida: utilidad en tareas y jurisdicciones no usadas en el desarrollo, con los mismos límites y los mismos expertos evaluadores. Decisión: no dar por transferida una capacidad jurídica a partir de un resultado en entornos abstractos.
Fuente declarada: ARC Prize · Fireworks AI · OpenAI's GPT-6 Astra on ARC-AGI-3 (se abre en una pestaña nueva) · Post-training Kimi K3 with Harvey for long-horizon legal work (se abre en una pestaña nueva)
Construcción de herramientas
Evidencia requerida: componente con especificación, pruebas independientes, revisión, versión y dueño. Decisión: separar generar, validar y desplegar, y dejar la lógica determinista bajo autorización explícita.
Fuente declarada: OpenAI · Anthropic (guía de migración) · GPT-6 Astra: A new generation of intelligence (se abre en una pestaña nueva) · Migration vers Claude Fable 5.1 et Claude Mythos 5.1 (se abre en una pestaña nueva)
Autoevaluación y corrección
Evidencia requerida: menos errores escapados en casos nuevos, medidos por controles distintos del propio sistema. Decisión: no auditar sobre explicaciones autorreportadas; medir errores críticos y concilios.
Fuente declarada: OpenAI (ficha de seguridad) · ARC Prize · Safety overview: GPT-6 Astra (se abre en una pestaña nueva) · OpenAI's GPT-6 Astra on ARC-AGI-3 (se abre en una pestaña nueva)
Coordinación multiagente
Evidencia requerida: calidad conjunta, permisos, trazabilidad y presupuesto, comparados con un proceso más simple. Decisión: no confundir consenso entre agentes con independencia de criterio.
Fuente declarada: Fireworks AI · Anthropic · Post-training Kimi K3 with Harvey for long-horizon legal work (se abre en una pestaña nueva) · Introducing Claude Fable 5.1 and Claude Mythos 5.1 (se abre en una pestaña nueva)
Autoridad transaccional
Evidencia requerida: facultad expresamente concedida, distinta del poder técnico, del presupuesto de gasto y de la capacidad de producción. Decisión: separar gasto, lectura, escritura, comunicación y transacción, con identidad, mandato, límites y revocación. Las fuentes tecnológicas no son fuentes de potestad jurídica.
Fuente declarada: Stripe · OpenAI (ficha de seguridad) · Stripe agrees to acquire OpenRouter to help businesses optimize token routing and usage (se abre en una pestaña nueva) · Safety overview: GPT-6 Astra (se abre en una pestaña nueva)
Economía de la inferencia
Evidencia requerida: coste por resultado aceptado sumando inferencia, caché, herramientas, reintentos, validación y revisión, con fallos y variabilidad visibles. Decisión: revisar pricing y staffing solo con evidencia del proceso.
Fuente declarada: Stripe · OpenRouter · Anthropic · Stripe agrees to acquire OpenRouter to help businesses optimize token routing and usage (se abre en una pestaña nueva) · OpenRouter is Joining Stripe (se abre en una pestaña nueva) · Introducing Claude Fable 5.1 and Claude Mythos 5.1 (se abre en una pestaña nueva)
Tres escenarios refutables
Escenarios institucionales, sin probabilidad ni fecha. Cada uno declara qué señales lo sostendrían, qué decisión abre y qué observación lo debilitaría.
Escenario refutable
Aceleración gobernada
La firma adapta modelos sin perder el control del conocimiento, los permisos y los criterios. La factoría interna produce activos reutilizables y el cliente percibe más cobertura o menos tiempo.
- Señales que lo sostienen
- Aceptación sostenida en pruebas nuevas, menor revisión neta, salida probada del proveedor y decisiones del ledger efectivamente ejecutadas.
- Decisión que abre
- Invertir en evaluación, integración y talento al mismo nivel que en licencias.
- Qué lo debilitaría
- La mejora desaparece al cambiar de muestra, de jurisdicción o de revisor.
Escenario refutable
Industrialización dependiente
La productividad aumenta con una plataforma, pero las skills, la telemetría, los workflows y la interfaz quedan en capas que no se pueden sustituir razonablemente.
- Señales que lo sostienen
- Exportaciones incompletas, ausencia de alternativa ensayada y precios sin visibilidad por proceso.
- Decisión que abre
- Aceptar la dependencia de forma deliberada y documentada, o negociar salida y titularidad de los activos.
- Qué lo debilitaría
- Una migración conserva calidad y continuidad con un coste asumible.
Escenario refutable
El cliente se convierte en orquestador
Los sistemas del cliente preparan el problema y consumen servicios jurídicos reservando a la firma intervenciones concretas.
- Señales que lo sostienen
- APIs y entregables estructurados, menos encargos preparatorios y exigencia de trazabilidad.
- Decisión que abre
- Construir oferta por resultado y contrastarla directamente con el cliente.
- Qué lo debilitaría
- El cliente mantiene el alcance del encargo y no desarrolla capacidad propia ni demanda integración.
Comprar, asociarse, construir y controlar no son alternativas excluyentes
Comprar capacidad de frontera donde supere las pruebas; asociarse con productos verticales cuando reduzcan el tiempo hasta obtener valor; construir solo componentes cuya diferenciación justifique mantenimiento; y controlar siempre contratos, permisos, conocimiento autorizado, reglas, evaluaciones y salida. Controlar no exige programarlo todo: exige conservar derechos y mecanismos efectivos de verificación, cambio y retirada.
Una firma no necesita un corpus único. Necesita dominios separados por práctica, cliente y asunto, con metadatos, vigencia, permisos y procedencia. El conocimiento institucional y los playbooks no deben convertirse, por defecto, en memoria de un proveedor. Cualquier aprendizaje o postentrenamiento exige un acuerdo explícito sobre datos, uso, titularidad, evaluación y eliminación. Esto es un criterio de diseño, no una afirmación de que Tenet haya utilizado datos de clientes: Harvey declara lo contrario para ese entrenamiento.
Ni una plataforma vertical ni un gateway multimodelo sustituyen el gobierno propio. El modelo de partnership debe resolver quién paga por los activos comunes, quién los mantiene y cómo reconoce a quienes los construyen. Sin esas decisiones, una mejora de capacidad puede quedarse en productividad individual o trasladarse íntegramente al cliente en descuentos.
Partnership y resultado
La pregunta económica y la pregunta de gobierno son la misma pregunta formulada dos veces.
Si un workflow reduce su coste, alguien decide qué parte de ese ahorro se destina a precio, a margen, a capacidad instalada y a inversión en nuevos activos. Sin esa decisión explícita, el reparto lo determina la presión comercial del trimestre y la firma pierde la oportunidad de financiar su propia transformación.
Hay tres responsabilidades que suelen quedar sin dueño: quién financia el conocimiento y las evaluaciones comunes, quién mantiene las skills cuando cambia una versión o una norma, y quién responde por la salida cuando el trabajo se ha ejecutado en parte con sistemas. Ninguna se resuelve con un comité informativo.
Queda una cuarta, que es la más lenta de reparar: cómo se repone el aprendizaje cuando desaparecen las tareas junior que servían de formación. La adopción de licencias no es un sustituto de decisiones ejecutadas; medir asientos activos dice poco sobre si algo de esto se ha resuelto.
Seis decisiones en 90 días
Propuestas del Observatorio, estructuradas y verificables. Ninguna depende de acertar una fecha, y ninguna se registra automáticamente: el ledger lo alimenta la firma.
| Decisión | Responsable | Evidencia | Plazo, trigger y salida |
|---|---|---|---|
| Reevaluar tres workflows ancla | Práctica y equipo de evaluación | Misma muestra nueva, fuentes y rúbrica fijadas, fallos retenidos, tasa de aceptación y revisión neta | 0 a 30 días; trigger: la calidad, el coste o el tiempo cambian más allá del umbral aprobado. Salida: promover, limitar o rechazar |
| Inventariar dependencias por capa | Arquitectura, Compras y Seguridad | Laboratorio, plataforma, gateway, nube, subproveedores y propiedad de los activos | 0 a 30 días; trigger: una dependencia sin alternativa en varios procesos críticos. Salida: negociar, preparar salida o aceptación expresa |
| Revisar rutas admisibles de datos | Riesgos, Privacidad, Seguridad y socio responsable | Retención, entrenamiento, acceso humano, residencia y custodia verificados por ruta | Antes de activar cada ruta; trigger: un fallback altera las condiciones del asunto. Salida: bloquear, reautorizar o usar alternativa |
| Fijar la economía por resultado | Finanzas, Pricing y Producto | Coste completo, aceptación, reintentos, correcciones y efecto en precio y capacidad | 30 a 60 días; trigger: baja el coste de inferencia sin bajar el coste neto ni subir el valor. Salida: rediseño de proceso, pricing o reparto |
| Contrastar la demanda del cliente | Socios de cliente y Desarrollo de negocio | Conversaciones sobre internalización, integración y resultados, sin subir datos confidenciales | 30 a 60 días; trigger: el cliente deja de comprar la tarea o exige otra interfaz. Salida: conservar, automatizar, reinventar o retirar |
| Convertir conocimiento en capacidad mantenible | Knowledge, People y prácticas | Skill con dueño, pruebas, jurisdicción, plan de mantenimiento y función de aprendizaje | 60 a 90 días; trigger: una automatización elimina función formativa sin reemplazo. Salida: presupuesto, reconocimiento y carrera |
- Aplicar la elegibilidad antes que cualquier comparación de rendimiento.
- Medir coste por resultado aceptado con la revisión humana incluida.
- Anotar en el ledger cada decisión derivada de este dossier, con owner, evidencia, trigger y sunset.
Alcance, cambios y cierre
Este dossier cubre las publicaciones datadas entre el 19 de agosto y el 3 de septiembre de 2026 y se cierra el 5 de septiembre de 2026. Las fuentes de proveedor acreditan anuncios, no validación independiente. La evaluación de ARC Prize es externa y específica, no una certificación jurídica. La nota metodológica de METR fija un límite de interpretación, no una predicción.
El salto no consiste solo en que la IA produzca mejores respuestas. Empieza a ejecutar trabajo, a participar en la construcción de las herramientas que lo ejecutan y a integrarse en una economía de capacidad consumible. La firma debe decidir qué controla y por qué seguirá siendo necesaria para el cliente.
Noticias que sostienen el dossier
Cada entrada separa el hecho observado, con su fuente, de la lectura del Observatorio.
- Harvey Tenet: el modelo especializado no sustituye a la arquitectura
Harvey presenta una investigación de postentrenamiento sobre Kimi K3. La señal estratégica es el intento de capturar valor en conocimiento especializado, entornos de evaluación y ejecución, además de en la interfaz jurídica.
- Stripe acuerda adquirir OpenRouter: la inferencia entra en la infraestructura económica
El acuerdo sitúa el acceso y enrutado entre modelos junto a la facturación por uso y el control de costes. Cambia quién puede controlar la intermediación, no demuestra que haya llegado la AGI.
- Fable 5.1: más trabajo prolongado, otra economía de contexto y nuevas condiciones de uso
La actualización combina capacidad, coste de contexto y safeguards. Para una firma legal, el modelo más potente solo es candidato si su canal y sus condiciones permiten utilizarlo.
- Enterprise Frontier Safeguards: gobernar la custodia también es gobernar la frontera
Anthropic anuncia que los datos de monitorización se guarden en infraestructura del propio cliente. Es un compromiso relevante para el secreto profesional y, a la vez, una hoja de ruta por fases, no un control ya operativo.
- GPT-6 Astra: ejecutar más exige verificar de otra manera
OpenAI anuncia otro salto de capacidad y un despliegue escalonado. Su propia evaluación de seguridad introduce una cuestión central: mayor alineamiento no equivale a mayor facilidad de observación.
Señales derivadas
Inferencias del Observatorio, con confianza media, incorporadas al feed de señales.
- El postentrenamiento vertical convierte el conocimiento de la firma en activo negociable
Cuando un proveedor especializa un modelo con criterio jurídico, la pregunta deja de ser qué modelo se usa y pasa a ser de quién es la mejora resultante.
- El harness multimodelo desplaza la evaluación del prompt al resultado
Orquestación, reintentos, caché y reconciliación de cambios explican una parte de la calidad que suele atribuirse al modelo.
- El enrutado de inferencia se comporta como infraestructura económica
Quien decide a qué modelo va cada tarea captura también la información de coste y uso. La pluralidad de modelos no elimina la dependencia del intermediario.
- La frontera agéntica separa lo que el sistema puede hacer de lo que se le permite hacer
Los saltos de capacidad anunciados en septiembre de 2026 no amplían por sí mismos la autoridad de ejecución. Esa decisión sigue siendo institucional.
- El coste que importa es el del resultado aceptado, no el del token
Abaratar el contexto puede reducir el coste neto, incluso sin cambiar la revisión. La magnitud del ahorro se mide sobre el proceso completo, con herramientas, reintentos y trabajo humano incluidos.
- La aceleración observable no acredita inteligencia artificial general
Un salto medido en una evaluación externa justifica revisar decisiones. No demuestra AGI ni autoriza a delegar actos con efectos frente a terceros.
Fuentes primarias
Publicaciones de las partes interesadas y, en el caso de ARC Prize, evaluación independiente. Lo que no consta es validación externa sobre workflows jurídicos ni jurisdicciones concretas.
- Post-training update: Harvey Tenet Research Preview (se abre en una pestaña nueva) · Harvey · 2026-08-20
- Qué afirma
- Harvey describe Tenet como research preview basado en Kimi K3, postentrenado para trabajo jurídico prolongado, y declara no haber utilizado datos de clientes.
- Qué no permite afirmar
- Publicación de una parte interesada sobre un preview de investigación. No acredita disponibilidad general, licencia ni rendimiento por jurisdicción.
- Post-training Kimi K3 with Harvey for long-horizon legal work (se abre en una pestaña nueva) · Fireworks AI · 2026-08-26
- Qué afirma
- Publica resultados all-pass del 19,7 % frente al 10,8 % del modelo base en la evaluación LAB, con juez LLM. En LAB Contracts, que es una evaluación distinta, publica 11,3 % frente a 9,3 %.
- Qué no permite afirmar
- Coautoría del mismo desarrollo, no una auditoría independiente. All-pass no equivale a precisión jurídica general y las cifras de LAB y de LAB Contracts no son intercambiables.
- Stripe agrees to acquire OpenRouter to help businesses optimize token routing and usage (se abre en una pestaña nueva) · Stripe · 2026-08-19
- Qué afirma
- Anuncia un acuerdo para adquirir OpenRouter y vincula la selección de modelos por rendimiento, velocidad y coste con la economía de los negocios de IA.
- Qué no permite afirmar
- Acuerdo anunciado y sujeto a condiciones de cierre, no operación consumada. No consta precio oficial publicado por las partes.
- OpenRouter is Joining Stripe (se abre en una pestaña nueva) · OpenRouter · 2026-08-19
- Qué afirma
- Declara continuidad de nombre, producto y hoja de ruta tras el acuerdo anunciado.
- Qué no permite afirmar
- Declaración de intenciones de la parte adquirida. No garantiza tarifas, incentivos de enrutado ni condiciones contractuales futuras.
- GPT-6 Astra: A new generation of intelligence (se abre en una pestaña nueva) · OpenAI · 2026-09-03
- Qué afirma
- Anuncia GPT-6 Astra para trabajo profesional, programación y uso de ordenador, con despliegue inicial limitado y ampliación posterior.
- Qué no permite afirmar
- Anuncio de proveedor. No acredita AGI, disponibilidad contractual por región ni fiabilidad en workflows jurídicos.
- Safety overview: GPT-6 Astra (se abre en una pestaña nueva) · OpenAI · 2026-09-03
- Qué afirma
- Describe el marco de seguridad y las salvaguardas declaradas para el modelo, incluida la monitorabilidad de su razonamiento.
- Qué no permite afirmar
- Documento del propio proveedor. No es una auditoría externa ni una fuente de potestad jurídica para delegar actos.
- OpenAI's GPT-6 Astra on ARC-AGI-3 (se abre en una pestaña nueva) · ARC Prize (firma Greg Kamradt) · 2026-09-03
- Qué afirma
- Evaluación externa: en ARC-AGI-3 Semi-Private, 62,7 % con harness estándar a esfuerzo máximo y 99,9 % con adaptador de proveedor a esfuerzo alto. El propio artículo declara que saturar ARC no prueba inteligencia artificial general.
- Qué no permite afirmar
- Cambian a la vez harness y esfuerzo, de modo que no es una comparación causal controlada. Los evaluadores declaran que no afirman haber demostrado AGI. No es una certificación jurídica. Comprobado el 5 de septiembre de 2026 sobre el texto indexado del dominio primario, no mediante réplica experimental.
- Introducing Claude Fable 5.1 and Claude Mythos 5.1 (se abre en una pestaña nueva) · Anthropic · 2026-09-01
- Qué afirma
- Presenta ambos modelos como el mismo modelo subyacente con salvaguardas y acceso distintos, y atribuye el ahorro estimado a la reducción del precio de lectura de caché.
- Qué no permite afirmar
- Afirmaciones del proveedor. Fable y Mythos no son equivalentes en acceso; el ahorro de caché no es el coste íntegro por tarea.
- Developing Enterprise Frontier Safeguards with our customers (se abre en una pestaña nueva) · Anthropic · 2026-09-01
- Qué afirma
- Anuncia datos de monitorización en infraestructura cloud controlada por el cliente, alertas al equipo del cliente y un despliegue por fases previsto para más adelante en otoño.
- Qué no permite afirmar
- Anuncio y hoja de ruta, no control ya operativo. No es una exención universal activada para todos los clientes, modelos, productos y rutas.
- Migration vers Claude Fable 5.1 et Claude Mythos 5.1 (se abre en una pestaña nueva) · Anthropic, Claude Platform Docs · consulta 2026-09-05
- Qué afirma
- Identifica cambios no retrocompatibles en herramientas y estado al migrar a la nueva versión.
- Qué no permite afirmar
- Documentación mutable y sin fecha de publicación estable; se cita por consulta del 5 de septiembre de 2026.
- Clarifying limitations of time horizon (se abre en una pestaña nueva) · METR · 2026-01-22
- Qué afirma
- Precisa qué mide y qué no mide el horizonte temporal de una evaluación de capacidad.
- Qué no permite afirmar
- Límite metodológico, no predicción sobre AGI ni estimación de duración de sesiones desatendidas.
Este dossier no introduce un tercer horizonte ni puntúa la proximidad de la inteligencia artificial general. Ordena hechos, lecturas y decisiones dentro de las dos lentes ya existentes.
Actualización temática revisada el 5 de septiembre de 2026. No implica revisión completa del archivo histórico ni certifica la idoneidad de ningún proveedor.
Comentario relacionado
Comentario · Estrategia y modelo de firma
YC financia firmas nativas de IA. Su siguiente competidor también será la IA.
Qué acreditan las firmas nativas de IA financiadas por Y Combinator, qué no demuestran y frente a qué alternativa deberán justificarse cuando el cliente acceda a la misma capacidad técnica.
Leer el comentario