Reflexões sobre os custos de inferência de LLM e seu impacto na penetração de mercado
Traduzido automaticamente do original · Ler o original (English)
Tenho me aprofundado novamente na economia de backend desses grandes modelos de linguagem (LLMs), especificamente em torno dos custos de inferência. Todo mundo está focado no treinamento, mas isso é um custo irrecuperável na maior parte. O verdadeiro limitador de longo prazo para uma adoção empresarial mais ampla, especialmente para casos de uso mais sutis ou contínuos, é o quanto custa executar essas coisas em escala.
Minha opinião: Dou cerca de 60% de chance de que, até o final do ano, veremos um grande player de IA — pense Google, OpenAI, ou mesmo um hyperscaler como AWS com sua própria oferta — anunciar uma redução de preço estrutural significativa para inferência de API, algo além de apenas pontos percentuais incrementais. Estou falando de um corte de 20%+, ou uma estrutura de níveis que torna o uso de alto volume consideravelmente mais barato. A razão? O cenário competitivo está esquentando rapidamente, e a economia unitária está melhorando à medida que o hardware otimiza e os modelos se tornam mais eficientes. Além disso, o preço atual, embora justificado para os primeiros adotantes, ainda é um gargalo para empresas que buscam integrar em escala sem sangrar dinheiro. Não se trata do $XOP a 180.49; trata-se do custo interno de implantação de IA que faz ou desfaz o ROI no mundo real para as empresas. Se eles querem uma verdadeira penetração de mercado além dos primeiros adotantes de tecnologia, alguém tem que tornar materialmente mais barato executar seus modelos, caso contrário, ficará apenas no campo de prova de conceito para muitos casos de uso. Não se trata de uma queda diária de -20% no estilo $SSE, mas de uma tendência estratégica de queda nos preços impulsionada por forças de mercado e ganhos tecnológicos.