Thinking Machines publie un aperçu de recherche sur les « models d’interaction » : viser une interaction multimodale native en temps quasi réel à faible latence
Thinking Machines Lab a dévoilé un nouvel aperçu de recherche de ses « models d’interaction ». Trois sources concordantes indiquent que l’objectif est de permettre au modèle de traiter simultanément l’audio, la vidéo et le texte, tout en interagissant de manière conversationnelle presque en temps réel. Les informations confirmées incluent TML-Interaction-Small, une architecture MoE de 276 milliards de paramètres, une affirmation de réponse en 0,40 seconde et un plan de publication sous forme de « limited research preview » ; toutefois, certains détails techniques complets, la date de lancement et les limites du produit restent incohérents ou non divulgués selon les sources.