Saltar al contenido

Dossier · agosto y septiembre 2026

El momento agéntico: capacidad, especialización y economía

La aceleración relevante está en la convergencia entre modelos más capaces, sistemas especializados e infraestructura económica para ejecutar trabajo. Justifica revisar decisiones ahora; no acredita por sí sola la llegada de la AGI.

  • Hechos contrastados
  • Inferencia editorial
  • Escenarios refutables

Revisión: 2026-09-05 · Fecha de corte editorial: 5 de septiembre de 2026. Todo lo posterior a esa fecha no está recogido aquí.

Revisión: 5 de septiembre de 2026. Los anuncios no certifican AGI; disponibilidad, condiciones y prestaciones pueden cambiar. 800/1600 siguen siendo lentes, no predicciones.

Contenido

Veredicto ejecutivo

La competencia se desplaza a configuraciones completas y a derechos de control, no únicamente a la mejor respuesta de un modelo. Lo que decide el resultado es el conjunto de modelo, harness, herramientas, corpus autorizado, criterios de aceptación y revisión humana, junto con las condiciones contractuales bajo las que ese conjunto puede utilizarse en un asunto real.

De ahí se sigue un requisito de diseño. Una arquitectura común debe admitir especialización sin perder gobierno, evidencia y capacidad de sustitución. Si adoptar un modelo especializado obliga a ceder el conocimiento, la telemetría o la evaluación, la mejora de capacidad se compra con una pérdida de control que no aparece en la factura.

La frontera puede avanzar en días. Las decisiones de una firma no deberían quedar inmovilizadas durante años. Marco editorial, no velocidad medida

Cinco hechos, con fecha y fuente

Cinco publicaciones entre el 19 de agosto y el 3 de septiembre de 2026. Los cinco hechos se apoyan en anuncios de las partes. La evaluación externa de ARC Prize se distingue y analiza por separado. Esa evaluación se recoge más abajo, en el apartado «Un salto medido no es una declaración de AGI».

Tres niveles, no una sola singularidad

Mezclar estos tres planos es la causa habitual de que un anuncio se lea como una prueba de algo que no demuestra.

  • Primer nivel, hecho observado: avance de capacidades medido bajo condiciones concretas de modelo, harness, esfuerzo y entorno. Es lo único que las publicaciones acreditan directamente.
  • Segundo nivel, inferencia editorial: una reorganización industrial que se deduce al combinar ejecución, distribución y economía. Es plausible y es una lectura del Observatorio, no un dato.
  • Tercer nivel, hipótesis abierta: AGI o auto-mejora general sostenida. Requiere evidencia adicional que ninguna de estas fuentes aporta.
  • El Observatorio no puntúa la proximidad a la AGI ni dibuja una fecha. Ausencia de prueba tampoco equivale a negar la posibilidad.

Qué no está demostrado

La distancia entre anuncio y capacidad utilizable en una firma es la parte que casi nunca se comunica.

  • Un anuncio de acuerdo no es una operación consumada. La adquisición anunciada el 19 de agosto quedaba sujeta a condiciones de cierre; titular que la compra se ha cerrado sería incorrecto.
  • Un research preview no es un producto disponible. No consta checkpoint público, licencia, condiciones de alojamiento ni oferta comercial verificada.
  • Una métrica de proveedor no es un benchmark independiente. Depende del harness, del dataset y de la rúbrica empleados, y no es comparable entre productos. Tampoco procede agregar cifras de estudios distintos del mismo proveedor, como los de razonamiento sobre documentos, operaciones, tablas de revisión o conocimiento de firma, como si todos midieran el mismo checkpoint de Tenet sobre Kimi K3: cada estudio declara su propia configuración.
  • Un despliegue escalonado no es disponibilidad general. Que exista documentación de API o un artículo de ayuda acredita que el modelo se está desplegando, no que cualquier cuenta, región o contrato pueda usarlo; y afirmar hoy que no está disponible para nadie sería igual de inexacto.
  • Un roadmap de salvaguardas no es un control ya operativo. Anunciar un despliegue por fases no equivale a una exención activada para todos los clientes, modelos y rutas.
  • Ninguno de estos anuncios acredita inteligencia artificial general. Ni los benchmarks ni una adquisición constituyen prueba de ello.

El ciclo de amplificación

Escenario, no hecho. Es un modelo de lectura del Observatorio y se ofrece con sus condiciones de refutación.

La IA ayuda a construir herramientas, conectores y pruebas. Esos activos permiten ejecutar más trabajo. La ejecución aporta información para evaluar y mejorar los sistemas. Y esa evaluación acelera la construcción de nuevas capacidades.

Cada transición del ciclo tiene un freno real: derechos sobre los datos, intervención humana necesaria, medición fuera de muestra, calidad y seguridad de lo generado, recursos disponibles y cambios organizativos. El ciclo no prueba auto-mejora ilimitada y no debe representarse como tal.

Capacidad: qué cambia en el trabajo

Los tres elementos que se mueven a la vez son el trabajo prolongado sin pérdida de hilo, el uso de herramientas y ordenador, y la ejecución multipaso coordinada entre varios agentes. Los proveedores describen mayor capacidad para combinar esas tres cosas. El alcance fiable debe comprobarse por workflow y jurisdicción.

Los resultados publicados corresponden al conjunto de modelo y harness; estas publicaciones no aíslan experimentalmente toda contribución. El harness abarca cómo se reparte el trabajo, qué contexto comparte cada agente, cómo se reconcilian cambios incompatibles y cuándo se repite solo una subtarea. Atribuir todo al modelo lleva a decisiones de compra equivocadas.

La latencia puede aumentar cuando se coordina más ejecución. Es un recordatorio útil: la métrica que importa a una firma es el resultado aceptado con la carga de revisión incluida, no la velocidad de una respuesta aislada.

Coste: la economía del contexto no es la economía del asunto

La reducción del precio de lectura de caché abarata un componente concreto: releer repetidamente el mismo material dentro de una ejecución. Una revisión que consulta cien veces el mismo expediente tiene una economía distinta de una consulta breve. Eso no es un ahorro total del trabajo jurídico.

El coste completo de un workflow incluye la inferencia de cada paso, las herramientas invocadas, los reintentos, la orquestación, el almacenamiento, la evaluación continua y, sobre todo, el tiempo humano de verificación. El ahorro de tokens puede ser real aunque la revisión humana no cambie; su importancia debe medirse dentro del coste completo por resultado aceptado.

Si el enrutado entre modelos pasa a estar junto a la facturación por uso, la información económica de cada ejecución se concentra en el canal. Una firma que no mide su propio coste por resultado queda dependiendo de la contabilidad de su intermediario.

  1. Medir coste por resultado aceptado y por workflow, no coste por token ni por licencia.
  2. Incluir la carga humana de verificación en cada medición; sin ella, la comparación entre modelos no es informativa.
  3. Registrar la mezcla de modelos utilizada en cada workflow, para que un cambio de precios sea evaluable y no sorprenda en factura.

Control: elegibilidad antes que capacidad

Un modelo que no cumple las condiciones para procesar un asunto no es elegible para ese uso, aunque pueda servir para otras tareas con datos públicos. La secuencia correcta es primero canal, dato, residencia, retención y acceso; después rendimiento.

No-training, no-retention, residencia y custodia son compromisos distintos y con frecuencia se confunden en uno solo. Los anuncios de septiembre lo hacen visible: un mismo modelo base puede ofrecerse con condiciones diferentes según el producto y el canal, y una exención temporal durante un despliegue no es un régimen permanente ni generalizable a cualquier cliente.

El otro elemento de control es la evidencia. Si la cadena de razonamiento se vuelve menos legible, la supervisión no puede consistir en leer una explicación plausible. Debe apoyarse en el registro de acciones autorizadas, las fuentes consultadas, el estado de los sistemas tocados y los criterios de aceptación aplicados. La propia monitorización trata información sensible: el audit trail no debe convertirse en un duplicado indiscriminado de expedientes.

  1. Construir una matriz de modelo por canal, tipo de dato, residencia, retención y acceso, y mantenerla viva.
  2. Pilotar sin información de asuntos hasta que exista aprobación formal documentada.
  3. Recertificar workflows y herramientas al cambiar de versión: un modelo nuevo no hereda los permisos del anterior.

Cinco compromisos que no son el mismo compromiso

Marco del Observatorio, no asesoramiento de conformidad ni aprobación de ningún proveedor. La matriz sirve para no aceptar un compromiso como si acreditara los otros cuatro.

  • El coste tampoco es neutro: el proveedor no cobra por la salvaguarda, pero la infraestructura del cliente sí factura almacenamiento, lecturas, escrituras y salida de datos.
  • Custodiar el registro en casa mejora el control sobre la evidencia y no cambia por sí solo el comportamiento del modelo, el precio de la API ni los límites de uso.
CompromisoQué acredita si se cumpleQué documento o control exigir
No entrenamiento

Introducing Claude Fable 5.1 and Claude Mythos 5.1 (se abre en una pestaña nueva)

Que el contenido enviado no alimenta el entrenamiento del modelo en esa ruta concretaCláusula por producto y canal, con excepciones declaradas y fecha de vigencia
Retención cero o limitada

Developing Enterprise Frontier Safeguards with our customers (se abre en una pestaña nueva)

Cuánto tiempo persiste el contenido y con qué finalidad, no dónde se procesaPolítica de retención por ruta, incluidas exenciones transitorias y su fecha de fin
Residencia del procesamiento

Developing Enterprise Frontier Safeguards with our customers (se abre en una pestaña nueva)

Dónde se ejecuta la inferencia y qué subproveedores intervienenDeclaración de región de inferencia y de subencargados; almacenar registros en la Unión Europea no acredita que la inferencia ocurra allí
Custodia de la evidencia

Developing Enterprise Frontier Safeguards with our customers (se abre en una pestaña nueva)

Quién guarda los registros de actividad y monitorización, con qué claves y con qué accesoTitularidad del almacenamiento, gestión de claves, permisos de lectura y coste de almacenamiento, lecturas, escrituras y salida de datos, que corre a cargo del cliente
Revisión humana

Developing Enterprise Frontier Safeguards with our customers (se abre en una pestaña nueva)

Si personas del proveedor pueden leer contenido y en qué supuestosSupuestos de acceso humano, revisión automatizada disponible como opción y procedimiento de notificación al cliente
Elaboración del Observatorio sobre los anuncios del 1 de septiembre de 2026. Ninguna fila da por operativo un control anunciado; varias de estas opciones se activan a instancia del cliente y su despliegue estaba previsto por fases.

Cómo leer las cifras

Sin semáforos de aprobado y sin ranking cruzado entre productos. Cada fila indica qué mide la cifra y qué no permite concluir.

Cifra publicadaQué mideQué no permite concluir
LAB: 10,8 % del modelo base frente a 19,7 % all-pass del postentrenado

Post-training Kimi K3 with Harvey for long-horizon legal work (se abre en una pestaña nueva)

Cumplimiento de todos los criterios de un entregable en una evaluación descrita por las partes participantes, con juez LLMNo es precisión jurídica general ni validación independiente; all-pass y criterios parciales no son la misma medida
ARC-AGI-3 Semi-Private: 62,7 % con harness estándar a esfuerzo máximo y 99,9 % con adaptador de proveedor a esfuerzo alto

OpenAI's GPT-6 Astra on ARC-AGI-3 (se abre en una pestaña nueva)

Generalización en entornos abstractos interactivos bajo dos configuraciones distintas del mismo modeloNo es prueba jurídica ni comparación causal controlada: cambian a la vez el harness y el esfuerzo
Fable 5.1: ahorro estimado por lectura de caché

Introducing Claude Fable 5.1 and Claude Mythos 5.1 (se abre en una pestaña nueva)

El precio de releer contexto ya almacenado dentro de una ejecuciónNo es el coste íntegro por tarea ni una rebaja de todas las tarifas; son afirmaciones del proveedor
Enterprise Frontier Safeguards: despliegue por fases y elegibilidad

Developing Enterprise Frontier Safeguards with our customers (se abre en una pestaña nueva)

Un compromiso anunciado de custodia de datos de monitorización en infraestructura del clienteNo es disponibilidad general ni una exención universal ya activada para todos los clientes y rutas
Lectura de cifras publicadas entre el 20 de agosto y el 3 de septiembre de 2026. Elaboración del Observatorio; no se ordenan productos entre sí.

Un salto medido no es una declaración de AGI

Existe una evaluación independiente de la nueva generación de modelos. Publicada por ARC Prize el 3 de septiembre de 2026, permite equilibrar la lectura y, a la vez, fija sus propios límites.

  • En ARC-AGI-3 Semi-Private, ARC Prize publica para GPT-6 Astra un 62,7 % con harness estándar a esfuerzo máximo y un 99,9 % con adaptador de proveedor a esfuerzo alto. Entre ambas filas cambian dos cosas a la vez, el harness y la configuración de esfuerzo, de modo que no es una comparación causal controlada y no cabe atribuir toda la diferencia al harness.

    Fuente declarada: ARC Prize, 3 septiembre 2026 · OpenAI's GPT-6 Astra on ARC-AGI-3 (se abre en una pestaña nueva)

  • Los evaluadores describen un salto significativo de generalización en entornos abstractos interactivos y declaran expresamente que saturar esta evaluación no probaría inteligencia artificial general.

    Fuente declarada: ARC Prize, artículo firmado por Greg Kamradt · OpenAI's GPT-6 Astra on ARC-AGI-3 (se abre en una pestaña nueva)

  • El conjunto de resultados verificados lleva fecha del 2 de septiembre de 2026 y recoge doce configuraciones del mismo modelo; el artículo que los comenta es del día 3. Son dos piezas con fechas distintas y conviene no igualarlas.

    Fuente declarada: ARC Prize (resultados verificados) · Verified results: OpenAI GPT-6 Astra (se abre en una pestaña nueva)

  • La hoja de resultados de Claude Fable 5.1, del 1 de septiembre de 2026, recoge marcas en ARC-AGI-1 y ARC-AGI-2 y deja la columna de ARC-AGI-3 sin puntuación, que es ausencia de dato y no un cero. No procede comparar esas cifras con el resultado de Astra en ARC-AGI-3 ni ordenar modelos por inteligencia.

    Fuente declarada: ARC Prize (hoja de resultados de Claude Fable 5.1) · Verified results: Anthropic Claude Fable 5.1 (se abre en una pestaña nueva)

  • Es una evaluación independiente relevante, y conviene decirlo con precisión: lo que no está acreditado es una validación independiente sobre los workflows jurídicos y las jurisdicciones concretas de una firma. Afirmar que no existe ninguna evaluación externa sería inexacto.
  • Un resultado en entornos abstractos interactivos no es un ensayo jurídico ni una garantía de fiabilidad general en producción.
  • La lectura útil para una firma no es la puntuación, sino que el harness y la configuración explican una parte material del resultado. Comparar las dos mejores filas no aísla la contribución del harness, porque el esfuerzo también cambia.
  • El horizonte temporal de un benchmark estima dificultad a partir del tiempo que tardaría una persona. No equivale a la duración de una sesión desatendida ni a una autorización profesional.
  • Nota de método: estas cifras se han contrastado sobre el texto publicado en el dominio del evaluador, consultado el 5 de septiembre de 2026, no mediante réplica del experimento. Que una descarga automática falle no significa que la página no exista: la accesibilidad automática y la comprobación editorial son cosas distintas.

¿Singularidad o compresión del tiempo de decisión?

Interpretación del Observatorio. Hipótesis estratégica, no anuncio de AGI.

Estas noticias no acreditan por sí solas una singularidad tecnológica ni resuelven la definición de AGI. Sí permiten formular una hipótesis de trabajo: si sistemas más capaces pueden construir parte del software que necesitan, reutilizar contexto y ejecutar procesos con menor fricción, el tiempo entre una capacidad técnica y su incorporación a un servicio puede acortarse. La decisión institucional podría convertirse en el tramo más lento de la cadena.

El Observatorio llama a esto una posible discontinuidad operativa, no una singularidad demostrada. Hay que separar cuatro preguntas: qué puede hacer un sistema en una evaluación; qué hace de forma fiable en un workflow; bajo qué condiciones puede desplegarse; y qué autoridad puede delegarse. Una respuesta afirmativa a la primera no resuelve las otras tres.

El bucle a vigilar es capacidad, construcción de herramientas, procesos más amplios y evaluación y aprendizaje institucional. No debe representarse como auto-mejora autónoma ilimitada. Cada transición depende de acceso, datos, experimentación, control y personas. No hace falta esperar a una etiqueta AGI para actuar.

El efecto para la firma puede ser doble: sus equipos pueden construir servicios antes inviables y sus clientes pueden resolver resultados antes externalizados. Una ganancia técnica se convierte en transformación institucional solo si cambia la asignación del trabajo, el servicio, el precio o la capacidad de decisión.

La frontera puede avanzar en días. Las decisiones de una firma no deberían quedar inmovilizadas durante años. Marco editorial, no velocidad medida

Seis matices de arquitectura

Cada matiz contrapone una simplificación que el Observatorio evita y la formulación que considera precisa. La simplificación no se atribuye a nadie: es la lectura corriente que conviene corregir.

Siete umbrales, revisados

Ninguno se marca como superado por un anuncio. Cada uno indica qué evidencia haría falta y qué decisión desencadena.

Tres escenarios refutables

Escenarios institucionales, sin probabilidad ni fecha. Cada uno declara qué señales lo sostendrían, qué decisión abre y qué observación lo debilitaría.

Escenario refutable

Aceleración gobernada

La firma adapta modelos sin perder el control del conocimiento, los permisos y los criterios. La factoría interna produce activos reutilizables y el cliente percibe más cobertura o menos tiempo.

Señales que lo sostienen
Aceptación sostenida en pruebas nuevas, menor revisión neta, salida probada del proveedor y decisiones del ledger efectivamente ejecutadas.
Decisión que abre
Invertir en evaluación, integración y talento al mismo nivel que en licencias.
Qué lo debilitaría
La mejora desaparece al cambiar de muestra, de jurisdicción o de revisor.

Escenario refutable

Industrialización dependiente

La productividad aumenta con una plataforma, pero las skills, la telemetría, los workflows y la interfaz quedan en capas que no se pueden sustituir razonablemente.

Señales que lo sostienen
Exportaciones incompletas, ausencia de alternativa ensayada y precios sin visibilidad por proceso.
Decisión que abre
Aceptar la dependencia de forma deliberada y documentada, o negociar salida y titularidad de los activos.
Qué lo debilitaría
Una migración conserva calidad y continuidad con un coste asumible.

Escenario refutable

El cliente se convierte en orquestador

Los sistemas del cliente preparan el problema y consumen servicios jurídicos reservando a la firma intervenciones concretas.

Señales que lo sostienen
APIs y entregables estructurados, menos encargos preparatorios y exigencia de trazabilidad.
Decisión que abre
Construir oferta por resultado y contrastarla directamente con el cliente.
Qué lo debilitaría
El cliente mantiene el alcance del encargo y no desarrolla capacidad propia ni demanda integración.

Comprar, asociarse, construir y controlar no son alternativas excluyentes

Comprar capacidad de frontera donde supere las pruebas; asociarse con productos verticales cuando reduzcan el tiempo hasta obtener valor; construir solo componentes cuya diferenciación justifique mantenimiento; y controlar siempre contratos, permisos, conocimiento autorizado, reglas, evaluaciones y salida. Controlar no exige programarlo todo: exige conservar derechos y mecanismos efectivos de verificación, cambio y retirada.

Una firma no necesita un corpus único. Necesita dominios separados por práctica, cliente y asunto, con metadatos, vigencia, permisos y procedencia. El conocimiento institucional y los playbooks no deben convertirse, por defecto, en memoria de un proveedor. Cualquier aprendizaje o postentrenamiento exige un acuerdo explícito sobre datos, uso, titularidad, evaluación y eliminación. Esto es un criterio de diseño, no una afirmación de que Tenet haya utilizado datos de clientes: Harvey declara lo contrario para ese entrenamiento.

Ni una plataforma vertical ni un gateway multimodelo sustituyen el gobierno propio. El modelo de partnership debe resolver quién paga por los activos comunes, quién los mantiene y cómo reconoce a quienes los construyen. Sin esas decisiones, una mejora de capacidad puede quedarse en productividad individual o trasladarse íntegramente al cliente en descuentos.

Partnership y resultado

La pregunta económica y la pregunta de gobierno son la misma pregunta formulada dos veces.

Si un workflow reduce su coste, alguien decide qué parte de ese ahorro se destina a precio, a margen, a capacidad instalada y a inversión en nuevos activos. Sin esa decisión explícita, el reparto lo determina la presión comercial del trimestre y la firma pierde la oportunidad de financiar su propia transformación.

Hay tres responsabilidades que suelen quedar sin dueño: quién financia el conocimiento y las evaluaciones comunes, quién mantiene las skills cuando cambia una versión o una norma, y quién responde por la salida cuando el trabajo se ha ejecutado en parte con sistemas. Ninguna se resuelve con un comité informativo.

Queda una cuarta, que es la más lenta de reparar: cómo se repone el aprendizaje cuando desaparecen las tareas junior que servían de formación. La adopción de licencias no es un sustituto de decisiones ejecutadas; medir asientos activos dice poco sobre si algo de esto se ha resuelto.

Seis decisiones en 90 días

Propuestas del Observatorio, estructuradas y verificables. Ninguna depende de acertar una fecha, y ninguna se registra automáticamente: el ledger lo alimenta la firma.

DecisiónResponsableEvidenciaPlazo, trigger y salida
Reevaluar tres workflows anclaPráctica y equipo de evaluaciónMisma muestra nueva, fuentes y rúbrica fijadas, fallos retenidos, tasa de aceptación y revisión neta0 a 30 días; trigger: la calidad, el coste o el tiempo cambian más allá del umbral aprobado. Salida: promover, limitar o rechazar
Inventariar dependencias por capaArquitectura, Compras y SeguridadLaboratorio, plataforma, gateway, nube, subproveedores y propiedad de los activos0 a 30 días; trigger: una dependencia sin alternativa en varios procesos críticos. Salida: negociar, preparar salida o aceptación expresa
Revisar rutas admisibles de datosRiesgos, Privacidad, Seguridad y socio responsableRetención, entrenamiento, acceso humano, residencia y custodia verificados por rutaAntes de activar cada ruta; trigger: un fallback altera las condiciones del asunto. Salida: bloquear, reautorizar o usar alternativa
Fijar la economía por resultadoFinanzas, Pricing y ProductoCoste completo, aceptación, reintentos, correcciones y efecto en precio y capacidad30 a 60 días; trigger: baja el coste de inferencia sin bajar el coste neto ni subir el valor. Salida: rediseño de proceso, pricing o reparto
Contrastar la demanda del clienteSocios de cliente y Desarrollo de negocioConversaciones sobre internalización, integración y resultados, sin subir datos confidenciales30 a 60 días; trigger: el cliente deja de comprar la tarea o exige otra interfaz. Salida: conservar, automatizar, reinventar o retirar
Convertir conocimiento en capacidad mantenibleKnowledge, People y prácticasSkill con dueño, pruebas, jurisdicción, plan de mantenimiento y función de aprendizaje60 a 90 días; trigger: una automatización elimina función formativa sin reemplazo. Salida: presupuesto, reconocimiento y carrera
Propuesta de actuación a 90 días; plazos orientativos, no benchmark validado. El Observatorio no crea entradas en el ledger ni utiliza datos de la firma.
  1. Aplicar la elegibilidad antes que cualquier comparación de rendimiento.
  2. Medir coste por resultado aceptado con la revisión humana incluida.
  3. Anotar en el ledger cada decisión derivada de este dossier, con owner, evidencia, trigger y sunset.

Alcance, cambios y cierre

Este dossier cubre las publicaciones datadas entre el 19 de agosto y el 3 de septiembre de 2026 y se cierra el 5 de septiembre de 2026. Las fuentes de proveedor acreditan anuncios, no validación independiente. La evaluación de ARC Prize es externa y específica, no una certificación jurídica. La nota metodológica de METR fija un límite de interpretación, no una predicción.

El salto no consiste solo en que la IA produzca mejores respuestas. Empieza a ejecutar trabajo, a participar en la construcción de las herramientas que lo ejecutan y a integrarse en una economía de capacidad consumible. La firma debe decidir qué controla y por qué seguirá siendo necesaria para el cliente.

Noticias que sostienen el dossier

Cada entrada separa el hecho observado, con su fuente, de la lectura del Observatorio.

Señales derivadas

Inferencias del Observatorio, con confianza media, incorporadas al feed de señales.

Fuentes primarias

Publicaciones de las partes interesadas y, en el caso de ARC Prize, evaluación independiente. Lo que no consta es validación externa sobre workflows jurídicos ni jurisdicciones concretas.

  • Post-training update: Harvey Tenet Research Preview (se abre en una pestaña nueva) · Harvey · 2026-08-20
    Qué afirma
    Harvey describe Tenet como research preview basado en Kimi K3, postentrenado para trabajo jurídico prolongado, y declara no haber utilizado datos de clientes.
    Qué no permite afirmar
    Publicación de una parte interesada sobre un preview de investigación. No acredita disponibilidad general, licencia ni rendimiento por jurisdicción.
  • Post-training Kimi K3 with Harvey for long-horizon legal work (se abre en una pestaña nueva) · Fireworks AI · 2026-08-26
    Qué afirma
    Publica resultados all-pass del 19,7 % frente al 10,8 % del modelo base en la evaluación LAB, con juez LLM. En LAB Contracts, que es una evaluación distinta, publica 11,3 % frente a 9,3 %.
    Qué no permite afirmar
    Coautoría del mismo desarrollo, no una auditoría independiente. All-pass no equivale a precisión jurídica general y las cifras de LAB y de LAB Contracts no son intercambiables.
  • Stripe agrees to acquire OpenRouter to help businesses optimize token routing and usage (se abre en una pestaña nueva) · Stripe · 2026-08-19
    Qué afirma
    Anuncia un acuerdo para adquirir OpenRouter y vincula la selección de modelos por rendimiento, velocidad y coste con la economía de los negocios de IA.
    Qué no permite afirmar
    Acuerdo anunciado y sujeto a condiciones de cierre, no operación consumada. No consta precio oficial publicado por las partes.
  • OpenRouter is Joining Stripe (se abre en una pestaña nueva) · OpenRouter · 2026-08-19
    Qué afirma
    Declara continuidad de nombre, producto y hoja de ruta tras el acuerdo anunciado.
    Qué no permite afirmar
    Declaración de intenciones de la parte adquirida. No garantiza tarifas, incentivos de enrutado ni condiciones contractuales futuras.
  • GPT-6 Astra: A new generation of intelligence (se abre en una pestaña nueva) · OpenAI · 2026-09-03
    Qué afirma
    Anuncia GPT-6 Astra para trabajo profesional, programación y uso de ordenador, con despliegue inicial limitado y ampliación posterior.
    Qué no permite afirmar
    Anuncio de proveedor. No acredita AGI, disponibilidad contractual por región ni fiabilidad en workflows jurídicos.
  • Safety overview: GPT-6 Astra (se abre en una pestaña nueva) · OpenAI · 2026-09-03
    Qué afirma
    Describe el marco de seguridad y las salvaguardas declaradas para el modelo, incluida la monitorabilidad de su razonamiento.
    Qué no permite afirmar
    Documento del propio proveedor. No es una auditoría externa ni una fuente de potestad jurídica para delegar actos.
  • OpenAI's GPT-6 Astra on ARC-AGI-3 (se abre en una pestaña nueva) · ARC Prize (firma Greg Kamradt) · 2026-09-03
    Qué afirma
    Evaluación externa: en ARC-AGI-3 Semi-Private, 62,7 % con harness estándar a esfuerzo máximo y 99,9 % con adaptador de proveedor a esfuerzo alto. El propio artículo declara que saturar ARC no prueba inteligencia artificial general.
    Qué no permite afirmar
    Cambian a la vez harness y esfuerzo, de modo que no es una comparación causal controlada. Los evaluadores declaran que no afirman haber demostrado AGI. No es una certificación jurídica. Comprobado el 5 de septiembre de 2026 sobre el texto indexado del dominio primario, no mediante réplica experimental.
  • Introducing Claude Fable 5.1 and Claude Mythos 5.1 (se abre en una pestaña nueva) · Anthropic · 2026-09-01
    Qué afirma
    Presenta ambos modelos como el mismo modelo subyacente con salvaguardas y acceso distintos, y atribuye el ahorro estimado a la reducción del precio de lectura de caché.
    Qué no permite afirmar
    Afirmaciones del proveedor. Fable y Mythos no son equivalentes en acceso; el ahorro de caché no es el coste íntegro por tarea.
  • Developing Enterprise Frontier Safeguards with our customers (se abre en una pestaña nueva) · Anthropic · 2026-09-01
    Qué afirma
    Anuncia datos de monitorización en infraestructura cloud controlada por el cliente, alertas al equipo del cliente y un despliegue por fases previsto para más adelante en otoño.
    Qué no permite afirmar
    Anuncio y hoja de ruta, no control ya operativo. No es una exención universal activada para todos los clientes, modelos, productos y rutas.
  • Migration vers Claude Fable 5.1 et Claude Mythos 5.1 (se abre en una pestaña nueva) · Anthropic, Claude Platform Docs · consulta 2026-09-05
    Qué afirma
    Identifica cambios no retrocompatibles en herramientas y estado al migrar a la nueva versión.
    Qué no permite afirmar
    Documentación mutable y sin fecha de publicación estable; se cita por consulta del 5 de septiembre de 2026.
  • Clarifying limitations of time horizon (se abre en una pestaña nueva) · METR · 2026-01-22
    Qué afirma
    Precisa qué mide y qué no mide el horizonte temporal de una evaluación de capacidad.
    Qué no permite afirmar
    Límite metodológico, no predicción sobre AGI ni estimación de duración de sesiones desatendidas.

Este dossier no introduce un tercer horizonte ni puntúa la proximidad de la inteligencia artificial general. Ordena hechos, lecturas y decisiones dentro de las dos lentes ya existentes.

Actualización temática revisada el 5 de septiembre de 2026. No implica revisión completa del archivo histórico ni certifica la idoneidad de ningún proveedor.

Comentario relacionado

Comentario · Estrategia y modelo de firma

YC financia firmas nativas de IA. Su siguiente competidor también será la IA.

Qué acreditan las firmas nativas de IA financiadas por Y Combinator, qué no demuestran y frente a qué alternativa deberán justificarse cuando el cliente acceda a la misma capacidad técnica.

Leer el comentario