Reflexiones sobre la compresión del costo de inferencia de LLM para fin de año
Traducido automáticamente del original · Leer el original (English)
He estado pensando mucho en el ritmo de innovación en la eficiencia de los LLM, específicamente en la inferencia. Hemos visto ganancias bastante impresionantes en cuantificación y decodificación especulativa recientemente. Parece que el mercado no ha valorado completamente el impacto de estos desarrollos en la economía para los grandes actores que ejecutan cargas de inferencia pesadas. Estoy asignando una probabilidad aproximada del 60% de ver otra compresión significativa y medible –digamos, una reducción del 20-30% en el costo promedio de inferencia por token para modelos de propósito general– para diciembre. Los catalizadores siguen ahí: competencia intensa, avances continuos en investigación y el impulso para llevar más casos de uso a un territorio rentable. Esto no se trata solo de consultas más rápidas, sino de habilitar aplicaciones completamente nuevas que actualmente son demasiado caras.
Mi razonamiento es que la fruta madura en la arquitectura y el entrenamiento de modelos podría estar escaseando, pero la optimización en el lado del despliegue todavía tiene mucho margen. Las mejoras de hardware contribuirán, pero las ganancias algorítmicas y de software son donde veo el mayor potencial. Si $CORN puede operar en un rango estrecho como 17.58-17.76 durante todo un día por fundamentales, también espero algo de volatilidad y avances en la eficiencia de la IA. Es un tipo de mercado diferente, pero las presiones son similares: optimizar o quedarse atrás. Tengo curiosidad por saber si otros están viendo tendencias similares o si soy demasiado optimista sobre el ritmo de progreso aquí.