Lógica Tecnológica / Frontera de la Inteligencia

Thinking Machines publica una vista previa de investigación de “interaction models”: apunta a la interacción multimodal nativa de baja latencia en tiempo real

Thinking Machines Lab ha presentado una nueva vista previa de investigación de su próxima generación de “interaction models”. Tres fuentes coinciden en que el objetivo es permitir que el modelo procese audio, video y texto al mismo tiempo, y mantenga una interacción conversacional casi en tiempo real. Entre los datos confirmados figuran TML-Interaction-Small, una arquitectura MoE de 276.000 millones de parámetros, la afirmación de un tiempo de respuesta de 0,40 segundos y un plan de lanzamiento posterior como “limited research preview”; sin embargo, aún existen discrepancias o vacíos informativos sobre los detalles técnicos completos, la fecha de publicación y los límites del producto.

Resumen TSO

  • Thinking Machines Lab ha presentado una nueva vista previa de investigación de su próxima generación de “interaction models”. Tres fuentes coinciden en que el objetivo es permitir que el modelo procese audio, video y texto al mismo tiempo, y mantenga una interacción conversacional casi en tiempo real. Entre los datos confirmados figuran TML-Interaction-Small, una arquitectura MoE de 276.000 millones de parámetros, la afirmación de un tiempo de respuesta de 0,40 segundos y un plan de lanzamiento posterior como “limited research preview”; sin embargo, aún existen discrepancias o vacíos informativos sobre los detalles técnicos completos, la fecha de publicación y los límites del producto.
  • Lógica Tecnológica · Frontera de la Inteligencia
  • 13 may 2026
Nota de TSOCada artículo se contrasta con informes independientes. Los enlaces a las fuentes originales acompañan el análisis para que los lectores puedan revisar la evidencia directamente.

Transparencia de fuentes

Fuentes originales del reportaje

  1. Thinking Machines shows off preview of near-realtime AI voice and video conversation with new 'interaction models' - VentureBeatventurebeat.com
  2. Here’s what Mira Murati’s AI company is up to - The Vergewww.theverge.com
  3. Thinking Machines wants to build an AI that actually listens while it talks - TechCrunchtechcrunch.com

Perspectivas de las tres fuentes y conclusión de la verificación TSO:

  • Fuente 1 (VentureBeat) se centra en la vista previa técnica y afirma que la investigación introduce TML-Interaction-Small, un modelo Mixture-of-Experts (MoE) de 276.000 millones de parámetros, y subraya la importancia de “Interaction Model”, “Background Model” y una respuesta casi instantánea para la interacción en tiempo real.

  • Fuente 2 (The Verge) pone el foco en la dirección de la empresa y afirma que Thinking Machines avanza hacia los llamados “interaction models”, cuya característica es ingerir de forma continua audio, video y texto, y pensar, responder y actuar en tiempo real.

  • Fuente 3 (TechCrunch) destaca el producto y el calendario, y afirma que la empresa ha hecho públicos los interaction models, que TML-Interaction-Small responde en 0,40 segundos y que en los próximos meses se lanzará una “limited research preview”.

Conclusión de la verificación TSO: las tres fuentes se corroboran entre sí en lo esencial, ya que confirman el anuncio relacionado con Thinking Machines Lab y los “interaction models”, la entrada multimodal nativa (audio, video y texto) y el objetivo de interacción en tiempo real de baja latencia; sin embargo, no coinciden plenamente en los detalles de la arquitectura del modelo, la formulación de las métricas de respuesta y el calendario de publicación. Puede considerarse como “hechos centrales confirmados, con detalles técnicos y temporales que deben atribuirse por separado según la fuente”.

Hechos confirmados en común:

  1. La entidad implicada es Thinking Machines Lab.

  2. La empresa ha publicado o anunciado una vista previa de investigación o una línea de desarrollo relacionada con “interaction models”.

  3. Esta línea está orientada a una IA multimodal nativa, con procesamiento continuo de audio, video y texto.

  4. El objetivo es lograr una interacción conversacional casi en tiempo real y de baja latencia.

  5. La información pública menciona en todos los casos a TML-Interaction-Small.

Principales discrepancias o diferencias:

  1. Tamaño y arquitectura del modelo:

    • Solo la fuente 1 especifica un modelo Mixture-of-Experts (MoE) de 276.000 millones de parámetros.

    • Las fuentes 2 y 3 no mencionan el tamaño de parámetros ni la arquitectura MoE, por lo que no puede confirmarse a partir de ellas.

  2. Formulación del tiempo de respuesta:

    • La fuente 3 afirma que el modelo “responde en 0,40 segundos”.

    • Las fuentes 1 y 2 no ofrecen esa cifra concreta, por lo que no puede confirmarse si se refiere al mismo criterio de prueba o al mismo escenario.

  3. Calendario de publicación:

    • La fuente 3 menciona explícitamente que una “limited research preview” se lanzará en los próximos meses.

    • Las fuentes 1 y 2 no detallan un calendario; solo puede confirmarse que en el resumen del evento aparece un plan de lanzamiento posterior, pero no puede verificarse directamente en los textos de las tres fuentes proporcionadas, por lo que debe indicarse como “no confirmable a partir de las fuentes dadas”.

Contexto y análisis:
A partir del contenido común de las tres fuentes, el núcleo del anuncio no es una capacidad generativa de un solo modo, sino la integración de “escuchar, ver, hablar y responder” en un mismo marco de interacción, con recepción continua de audio, video y texto y una retroalimentación en tiempo real bajo condiciones de baja latencia. Esto significa que el enfoque central de la cobertura es el de “modelos de interacción” y no el de un modelo multimodal estático tradicional.
No obstante, sobre la ruta técnica de implementación, las fuentes disponibles solo permiten confirmar algunas afirmaciones públicas, como la estructura MoE, la respuesta en tiempo real y la naturaleza de vista previa de investigación. En cuanto a los datos de entrenamiento, los parámetros de evaluación, la forma de despliegue, los casos de uso reales y las limitaciones de seguridad, las fuentes dadas no ofrecen suficiente información, por lo que no es posible confirmarlo más allá.
Además, el enfoque de cada fuente se inclina respectivamente hacia la vista previa técnica, la dinámica corporativa y el ritmo de producto, lo que indica que la cobertura externa gira por ahora en torno a una fase de “prueba de concepto/vista previa de investigación” y aún no permite juzgar la madurez comercial del sistema.

Resumen de las tres fuentes:

  • Fuente 1 (VentureBeat): pone el acento en la vista previa técnica y añade detalles como TML-Interaction-Small, 276.000 millones de parámetros y la estructura MoE.

  • Fuente 2 (The Verge): destaca la definición de “interaction models”, es decir, recibir continuamente audio, video y texto y pensar, responder y actuar en tiempo real.

  • Fuente 3 (TechCrunch): subraya la velocidad de respuesta y el ritmo de publicación, afirmando que el modelo puede responder en 0,40 segundos e indicando que se trata de una vista previa de investigación limitada que se lanzará en los próximos meses.

Conclusión:
En conjunto, las tres fuentes permiten confirmar que Thinking Machines Lab ha convertido los “interaction models” en un eje público de su dirección de IA multimodal nativa, y que la cobertura externa los describe de forma coherente como una vista previa de investigación orientada a una interacción humano-máquina casi en tiempo real. En cuanto al tamaño del modelo, el alcance de las métricas de rendimiento y la futura apertura, por ahora solo puede atribuirse cada detalle a una fuente concreta; no es posible una confirmación unificada adicional a partir de las fuentes proporcionadas.

Lógica Tecnológica