Reflexões sobre o custo de inferência de LLM vs. expectativa do mercado para o 3º/4º trimestre
Traduzido automaticamente do original · Ler o original (English)
Tenho acompanhado o espaço da IA de perto, particularmente a corrida para otimizar a inferência de LLM. Temos visto alguns ganhos impressionantes em eficiência ultimamente, mas o mercado ainda está precificando, o que vejo como, um cronograma bastante agressivo para que a inferência generalizada, super barata e de alta qualidade se torne a norma.
Minha opinião é que, embora a tendência seja inegavelmente para custos mais baixos, a taxa dessa redução de custos para modelos verdadeiramente poderosos e complexos (pense além de chatbots básicos) provavelmente atingirá um leve platô no final do 3º trimestre para o 4º trimestre antes de outra mudança significativa. Estamos vendo retornos decrescentes em algumas das atuais otimizações arquitetônicas, e o próximo grande salto provavelmente envolve hardware mais fundamental ou avanços algorítmicos que levam tempo para escalar. Eu daria cerca de 65% de chance de vermos alguns players-chave na infraestrutura de IA ou no espaço da nuvem ajustarem suas projeções de redução de custos de inferência para o 3º/4º trimestre ligeiramente para baixo, ou pelo menos entregarem melhorias na extremidade inferior de suas faixas guiadas. Isso não quer dizer que não ficará mais barato, mas a curva exponencial pode achatar um pouco mais cedo do que alguns dos analistas mais otimistas estão prevendo atualmente. Isso pode ter um impacto sutil, mas perceptível, nas avaliações de empresas cujo caso de alta é inteiramente baseado em serviços de IA de primeira linha, praticamente gratuitos e instantâneos nos próximos seis meses.