Por: Mustafa Suleyman.
El Tokenmaxxing (maximizar la eficiencia de cada token en el modelo) ha sido la historia de los últimos meses, pero la eficiencia de tokens es el siguiente gran foco en la industria. ¿Cómo conseguimos el mejor rendimiento posible por token invertido y el mejor resultado real para el cliente por cada dólar invertido?
Para construir una Frontier Firm, hay que optimizar el rendimiento de la frontera frente al coste. Elegir dónde quieren situarse en esa curva es fundamental. A través de optimizar de manera conjunta sus modelos, harnesses (herramientas de prueba) y entornos de ejecución (RLEs) pueden elegir un punto de la curva que se adapte a tu empresa.
En la mayoría de los casos, los modelos Frontier generalistas no son necesarios para todas las tareas. Al ajustar modelos para un producto específico, pueden mantener o incluso superar el rendimiento de frontera, mientras reducen de manera importante los costes de tokens.
Aquí es donde hemos centrado nuestra máquina de subida de colinas MAI durante el último trimestre, y los resultados son bastante buenos. En estos días hemos lanzado MAI-Cyber-1-Flash optimizado para nuestro harness MDASH.
En conjunto, el sistema se situó en el número 1 del referente líder de CyberGym – para superar a Mythos por 12 puntos – a un 50% del coste. Y, de manera sorprendente, también lo servimos en los H100.
Fue diseñado para gestionar hasta el 90% de las tareas de manera eficiente, de modo que MDASH pueda reservar los modelos más grandes y caros de nuestra flota (en este caso GPT 5.4) para el 10% de problemas con una dificultad excepcional que en verdad los necesitan.
Como mencionó Satya en nuestra llamada de resultados del cuarto trimestre, desde el trimestre pasado hemos lanzado más de una docena de nuevos modelos en imagen, voz, transcripción, programación y seguridad, y ya impulsan muchos de los productos más utilizados de Microsoft para mantener o mejorar la calidad mientras usan de manera significativa menos tokens, en muchos casos para ahorrar entre un 50 y un 90% del coste de la GPU:
- Construimos MAI-Code-1-Flash de la mano con nuestros colegas de GitHub, donde desde junio millones de desarrolladores lo han utilizado en su trabajo diario. Un 10% más tasa de aceptación de código y un 10% menor en el uso mediano de tokens que GPT-5.4 Mini y Claude Haiku 4.5 en VS Code, para ya mostrar una mejor retención.
- Luego entrenamos ese mismo punto de control dentro de un entorno Excel RL para lograr un rendimiento comparable al de GPT-5.6 para las tareas más comunes, siendo más rentables y lo suficientemente pequeño para servir en un A100 o H100 frente a los aceleradores más modernos y caros.
- MAI-Image-2.5-Flash es ahora el predeterminado de extremo a extremo en Bing Image Creator, en producción en PowerPoint, donde reduce los costes de la GPU hasta un 84% en comparación con GPT-Image-2, y es el predeterminado para escenarios clave de edición de OneDrive, donde ha aumentado las tasas de guardado en un 26% y ofrece hasta 2,5 veces mayor eficiencia de tokens.
- MAI-Voice-2-Flash ahora impulsa el Centro de Contacto Dynamics 365, donde clientes como T-Mobile y EasyJet desarrollan sus agentes de call center, para reducir los costes de la GPU hasta en un 89%.
- MAI-Transcribe-1.5 ahora cubre el flujo de trabajo multilingüe de Dragon Copilot en 58 idiomas — una solución utilizada por 170.000 proveedores médicos que procesaron 28 millones de encuentros con pacientes el trimestre pasado, donde nuestras pruebas muestran una reducción relativa del 50% en las tasas de error en transcripción e identificación del idioma.
Y además, al diseñar en conjunto nuestros modelos con nuestro propio silicio, vemos un 40% más de rendimiento por vatio al ejecutar modelos MAI en Maia 200.
Pero el beneficio no es solo el coste. Es la resiliencia. Ahora toda empresa debe asumir que cualquier modelo del que depende podría desaparecer, ya sea por un incidente de seguridad, una desalineación empresarial o de política, o un cambio geopolítico.
Cada modelo en un producto o sistema agéntico debería ser sustituible, y eso solo es posible cuando construyen el harness, el contexto, la memoria y el espacio de acciones de manera independiente de una sola familia de modelos. Esa es la máquina de subir cuestas que hemos construido.
Creemos que esto es el comienzo de una curva de rendimiento en verdad nueva. Su forma representa un sistema más que un modelo, y recorrer esta curva ofrece mejor calidad, menor coste y más variedad.
Este ha sido un verano de trabajo duro pero maravilloso por parte del equipo. Somos muy conscientes de lo temprano que es esto y de cuánto aún nos queda por aprender. Pero la dirección es clara, subimos la cuesta para avanzar en la frontera de la curva coste-resultado, y compartiremos lo que aprendamos en el camino. Queda mucho más por venir.
The post Optimización de la curva de rendimiento Frontier appeared first on Source LATAM.
The post Optimización de la curva de rendimiento Frontier appeared first on Source LATAM.

