Reflexiones sobre el costo de inferencia de LLM vs. expectativa del mercado para Q3/Q4
Traducido automáticamente del original · Leer el original (English)
He estado siguiendo de cerca el espacio de la IA, particularmente la carrera por optimizar la inferencia de LLM. Hemos visto algunas ganancias bastante impresionantes en eficiencia últimamente, pero el mercado todavía está valorando, lo que yo veo, como un cronograma bastante agresivo para que la inferencia generalizada, súper barata y de alta calidad se convierta en la norma.
Mi opinión es que si bien la tendencia es innegablemente hacia costos más bajos, la tasa de esa reducción de costos para modelos verdaderamente potentes y complejos (piense más allá de los chatbots básicos) probablemente alcanzará una ligera meseta a fines del tercer trimestre y principios del cuarto trimestre antes de otro cambio significativo. Estamos viendo rendimientos decrecientes en algunos de los ajustes arquitectónicos actuales, y el próximo gran salto probablemente implique avances algorítmicos o de hardware más fundamentales que tardan en escalar. Yo diría que hay un 65% de probabilidades de que veamos a algunos actores clave en la infraestructura de IA o en el espacio de la nube ajustar ligeramente a la baja sus proyecciones de reducción de costos de inferencia para el tercer y cuarto trimestre, o al menos entregar mejoras en el extremo inferior de sus rangos guiados. Esto no quiere decir que no se abaratará, pero la curva exponencial podría aplanarse un poco antes de lo que pronostican algunos de los analistas más optimistas. Esto podría tener un impacto sutil pero notable en las valoraciones de las empresas cuyo caso alcista se basa completamente en servicios de IA prácticamente gratuitos, instantáneos y de primer nivel en los próximos seis meses.