Publicado el — Deja un comentario

El imperativo de maximizar el valor de la IA: convertir la infraestructura en inteligencia útil

El imperativo de maximizar el valor de la IA: convertir la infraestructura en inteligencia útil

Imagen compuesta de tres paneles que ilustra la innovación en semiconductores y su impacto en el mundo real. A la izquierda, una oblea de silicio iluminada en tonos azules es inspeccionada con un microscopio o equipo de manufactura de precisión. En el centro, vista aérea de personas cruzando un paso peatonal en una zona urbana. A la derecha, una investigadora con bata de laboratorio y gafas de seguridad trabaja con equipo electrónico en un laboratorio. La imagen utiliza una paleta de tonos azules fríos.

Por Rani Borkar, presidenta, sistemas de hardware e infraestructura de Azure.

Al entrar en la próxima era, ¿cuál será la medida definitoria de nuestro progreso?

Cada sector tiene una palabra que moldea su manera de pensar. Para los pilotos, es la seguridad. Para las aseguradoras, es el riesgo.

Para la industria de semiconductores, es el rendimiento útil.

El rendimiento útil no pregunta cuán elegante es la solución, cuántos años tardó o qué prometió la hoja de ruta. Más bien, plantea una pregunta sencilla: ¿Qué resultado útil producimos?

Durante más de 60 años, la industria de semiconductores se ha hecho esa pregunta, al maximizar de manera incansable el número de chips utilizables producidos a partir de cada oblea. Generación tras generación, oblea tras oblea, es justo esa disciplina la que convirtió al transistor de una curiosidad de laboratorio en la base de la vida moderna.

Hoy en día, debemos aplicar el mismo principio a los recursos sin precedentes que el mundo invierte en la IA: capital a una escala que antes estaba reservada para naciones, gigavatios de energía y fábricas y centros de datos récord.

La pregunta que definirá esta década es la misma que esta industria siempre se ha planteado: ¿Qué es lo que en realidad resulta? No solo chips y tokens, sino como inteligencia asequible, como trabajo que importa y como resultados que mejoran vidas.

Ese es el imperativo del rendimiento útil.

El límite de obtener más

La IA se ha proliferado a una velocidad notable, a un ritmo de adopción más rápido que internet, el PC o incluso el smartphone. Sin embargo, la penetración global se mantiene en solo el 18% de la población activa, y la gran mayoría de ese uso se basa en chats. A medida que los sistemas pasan de responder a preguntas individuales a razonar, planificar, usar herramientas y ejecutar flujos de trabajo agénticos más largos, la ecuación de infraestructura cambia de manera drástica. Una sola tarea agéntica puede usar más de 3.400 veces más tokens que una interacción típica de chat.

Gráfico de líneas titulado “Technology diffusion” que compara la velocidad de adopción de la electricidad, la radio, internet y los teléfonos celulares a lo largo del tiempo. Un marcador de “IA” aparece cerca del punto inicial, indicando que la adopción de la inteligencia artificial aún se encuentra en una etapa temprana en comparación con tecnologías anteriores.
Fuente: Informe de difusión de IA de Microsoft

Estamos solo en las primeras etapas de la adopción agéntica, y la infraestructura ya está sobrecargada. El poder ha puesto límites a lo que podemos construir y cuándo. Los paquetes y racks crecen y se vuelven más densos. La memoria se ha comenzado a convertir en una restricción aún más estricta.

Durante años, la respuesta racional de la industria a cada nuevo requisito resultó en más: más silicio en el paquete, más memoria al lado, más potencia para alimentarlo y más fibra para conectarlo. Cada generación aportó un progreso significativo. Pero cuando cada nueva ganancia requiere más entrada que la anterior, estamos en una cinta de correr. Solo se mueve mientras le sumemos más.

Creo que debemos seguir dos caminos hacia adelante. El primero es evolutivo: seguir con las mejoras a las arquitecturas que tenemos hoy, a través de impulsar la eficiencia, la utilización y la economía incrementales dentro de cada generación. El segundo es transformador: cambiar la propia curva con innovación en nuevas arquitecturas, nuevos materiales y nuevos enfoques para el diseño de sistemas y modelos.

La historia de nuestra industria está definida por transformaciones como estas. Cuando las velocidades de reloj crecientes de la CPU se toparon con el power wall, pasamos a procesadores multinúcleo. Cuando la NAND planar alcanzó sus límites, la memoria pasó a ser vertical.

Y ahora, una vez más, tenemos la oportunidad de desafiar nuestras suposiciones y repensar los fundamentos. Porque el próximo capítulo de la IA no se definirá sólo por la cantidad de infraestructura que construyamos, sino por cuánta inteligencia podamos crear a partir de ella.

Rendimiento útil en ingeniería

Diagrama de la pila tecnológica de IA que muestra, de abajo hacia arriba, centros de datos, energía y enfriamiento, chips, memoria, redes, software de orquestación, modelos y una capa de agentes. Junto al diagrama aparece la fórmula: “Capacidad × Velocidad de implementación × Utilización = Rendimiento útil”.

Durante décadas, la industria informática ha optimizado el rendimiento en el contexto de la fabricación. Hoy en día, esa disciplina debe extenderse a través de capas, desde los centros de datos y el silicio hasta los modelos y los arneses agentes que los orquestan. Y el trabajo no se detiene una vez que la tecnología está desarrollada. Entonces debemos desplegarla y escalarla más rápido, mientras desarrollamos nuevas herramientas y sistemas para maximizar su utilización en toda nuestra flota.

Desde el desarrollo hasta la ejecución, cada capa tiene su propio rendimiento útil, y las pérdidas y ganancias se acumulan a lo largo de ellas. La capacidad en una capa es solo un punto de partida. La verdadera medida es con qué tanta eficacia trabajan esas capas juntas para producir resultados útiles del sistema en su conjunto.

Nuestra experiencia en Microsoft en la construcción y operación de infraestructuras de IA a gran escala ha reforzado dos lecciones clave. Primero, las mayores limitaciones rara vez se resuelven en la capa donde aparecen. Segundo, cuando atacamos una restricción en toda la pila, los sacrificios que parecían inherentes al problema a menudo resultan ser artefactos de la arquitectura.

Los mayores avances suelen llegar cuando aplicamos estos aprendizajes a través del co-diseño, al trabajar a través de capas para convertir límites aparentes en restricciones solucionables del sistema. Las innovaciones en memoria, redes y energía muestran cómo es este enfoque en la práctica.

Memoria: Más inteligencia de cada byte

Hoy en día, la memoria se considera un problema de suministro o de componentes. En realidad, es un problema de sistema.

En la inferencia de IA, la memoria marca ahora los límites al rendimiento del sistema. Debe albergar modelos más grandes, preservar contextos más largos y entregar datos con la suficiente para que el cómputo se alimente. Y los agentes elevan el listón aún más. La generación, recuperación, uso de herramientas y memoria persistente se desarrollan juntos en bucles que pueden durar minutos u horas. El resultado es un horizonte de memoria mucho más largo, con mucha más información mantenida cerca del cómputo y disponible a lo largo de una secuencia de turnos en expansión. Hacerlo de manera eficiente y a gran escala definirá la próxima generación de infraestructura de IA.

Nuestra experiencia en la construcción de la plataforma Azure Maia demuestra que los cuellos de botella de memoria no se resuelven con una sola capa.

La arquitectura del modelo, la ciencia de datos y la compresión pueden reducir la cantidad de caché KV, que almacena el contexto de trabajo del modelo durante la generación. El software puede gestionar las jerarquías de memoria de manera más eficaz, el silicio puede optimizarse para la eficiencia del movimiento de datos y los compiladores pueden situar los datos más cerca del cómputo. Ningún cambio elimina la restricción. Juntos, aumentan la inteligencia útil que el sistema puede ofrecer desde los mismos recursos de memoria.

Eso es un rendimiento útil: no tan solo añadir bytes, sino obtener más inteligencia útil de cada byte que ya tenemos.

Redes: Diseñar entre capas

Al ampliar el nivel del clúster, vemos que la inteligencia no proviene de un solo chip. Proviene de miles de chips que operan como un solo sistema. Los enlaces más rápidos importan, pero la productividad del sistema también depende de la gestión de la congestión, la recuperación de fallos, la colocación de cargas de trabajo, la complejidad de programación y los límites entre silicio, sistema y software. Juntos, determinan si la computación costosa produce inteligencia o se queda inactiva.

Al diseñar la plataforma para Maia, no comenzamos con un diseño de red existente. Empezamos con el resultado que queríamos ofrecer: inferencia eficiente a escala de flota, al diseñar a través de silicio, redes y software de sistema. En lugar de estructuras separadas de escalado y escalado, construimos una red de escalado de dos niveles, integramos la funcionalidad de la NIC directo en el chip y desarrollamos una capa de transporte personalizada.

El resultado es un rendimiento escalable y consistente a través de clústeres densos de inferencia, con una estructura unificada que simplifica la programación, mejora la flexibilidad de la carga de trabajo y aprovecha mejor la capacidad disponible. Y con menos hardware de red necesario para ofrecer este rendimiento, también hemos reducido el coste de ejecutar todo el sistema.

Nuestro objetivo no es solo mover datos más rápido. Es mantener más computación productiva y entregar más tokens con cada vatio y cada dólar.

Energía: Co-diseño para la eficiencia, desde la red hasta el chip

Al pasar del clúster a la red, la IA ha introducido nuevos retos en cuanto a la disponibilidad, distribución y utilización de la energía. Los racks han pasado de decenas de kilovatios a cientos de kilovatios, y los campus de los centros de datos pueden operar a la escala de gigavatios. La energía solía ser algo a lo que el sistema tan solo se conectaba. Ahora, es algo en torno a lo que diseñamos, desde la red hasta el chip.

Por eso la industria ha comenzado a replantear la potencia en todo el sistema. Los transformadores de estado sólido y la entrega de energía de corriente continua de 800 voltios pueden reducir las pérdidas de distribución a medida que la energía avanza por la infraestructura. La energía y la refrigeración ya no son aguas abajo del diseño, sino que forman parte de la definición del producto desde el principio. Y cada vez más, ese codiseño es necesario hasta el silicio.

Azure Cobalt 200, nuestra CPU de servidor basada en Arm, muestra cómo es esto en la práctica. Diseñamos Cobalt para que cada núcleo tenga sus propios controles de voltaje y frecuencia, combinados con un límite de potencia basado en software por máquina virtual. Este control más detallado permite ajustes de potencia específicos mientras protege el rendimiento de cargas de trabajo críticas, permitiéndonos operar más servidores dentro del mismo límite de energía.

Como demuestra Cobalt, el diseño conjunto de hardware-software nos permite convertir cada megavatio en valor para el cliente de forma más eficaz.

Los avances entre fronteras

El patrón que observamos en memoria, red y potencia se extiende por todo el sistema: empieza con la salida útil y luego optimiza el conjunto en lugar de una sola capa. Esto primero requiere que seamos precisos sobre la salida para la que optimizamos y qué restricciones de diseño son realmente fijas. ¿Optimizamos para el máximo rendimiento o para un rendimiento sostenido del sistema? ¿Se beneficiaría la carga de trabajo de tener mucha más capacidad con una redundancia menor a nivel marginal? ¿Qué genera más valor: un conjunto más amplio de capacidades o un despliegue mucho más temprano en el cliente?

No todas las limitaciones en los sistemas actuales son leyes de la física. Algunas se heredan de decisiones tomadas en otras partes del sistema y solo pueden cambiar cuando trabajamos más allá de fronteras tradicionales. La evolución surge de las ganancias constantes que cada empresa impulsa dentro de su propio ámbito, pero la transformación llega cuando desafiamos esas suposiciones juntos y rediseñamos el sistema en su conjunto.

Los avances que se avecinan surgirán de la colaboración a través del ecosistema, para abarcar hiperescaladores y proveedores de silicio, fabricantes de equipos e innovadores de materiales, operadores de infraestructura y centros de datos, constructores de modelos y desarrolladores de software.

Hacia el rendimiento total

Pero los tokens y la inteligencia no son la línea de meta. Lo que producimos se convierte en la entrada para el trabajo de otra persona.

Lo que importa a continuación es hasta qué punto esa información se traduce en productividad en toda la economía y en valor en la vida de las personas, ya sea que ayude a un científico a acelerar el descubrimiento, a un clínico a identificar una señal antes, a un estudiante a recibir ayuda en el momento adecuado o a una pequeña empresa a encontrar un nuevo camino de crecimiento.

Eso ocurre a medida que la IA se convierte en parte del trabajo cotidiano en diferentes sectores y en todo el mundo. La gente construye sobre ella, surgen nuevos usos, las herramientas mejoran y el valor se acumula.

Para que ese ciclo se extienda, la IA debe ser accesible de manera amplia. Y a gran escala, la accesibilidad depende de la eficiencia. Es la única forma de desplegar suficiente inteligencia, y a un coste que permita que llegue a todos.

Cuando cada persona y cada empresa puede acceder a inteligencia, construir sobre ella y crear valor propio, eso es el rendimiento total.

Seguiremos con la construcción de la capacidad porque el mundo la necesitará. Pero nuestra medida definitoria de progreso debe ser lo que salga: no solo chips o tokens, sino inteligencia útil traducida en empoderamiento, oportunidad y logros humanos.

Ese es el imperativo de la rentabilidad. Y es un trabajo que toda nuestra industria debe asumir de manera conjunta.

Rani Borkar lidera las organizaciones principales responsables de planificar, arquitectura, desarrollo e implementación de hardware e infraestructura para la principal plataforma de computación en la nube de Microsoft — desde el silicio, hasta los sistemas y la cadena de suministro.

Descubran más sobre el enfoque de Microsoft de silicio a sistemas para la infraestructura de Azure.

The post El imperativo de maximizar el valor de la IA: convertir la infraestructura en inteligencia útil appeared first on Source LATAM.

 

​The post El imperativo de maximizar el valor de la IA: convertir la infraestructura en inteligencia útil appeared first on Source LATAM.  

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *