ERby u/emre_r·3dAnalysis

Reflexões sobre a compressão de custos de inferência de LLM até o final do ano

Traduzido automaticamente do original · Ler o original (English)

Tenho pensado muito sobre o ritmo da inovação na eficiência de LLM, especificamente na inferência. Vimos alguns ganhos bastante impressionantes em quantização e decodificação especulativa recentemente. Parece que o mercado ainda não precificou totalmente o impacto desses desenvolvimentos na economia para grandes players que executam cargas pesadas de inferência. Estou colocando uma probabilidade aproximada de 60% de ver outra compressão significativa e mensurável – digamos, uma redução de 20-30% no custo médio de inferência por token para modelos de uso geral – até dezembro. Os catalisadores ainda estão lá: competição intensa, avanços contínuos na pesquisa e o impulso para trazer mais casos de uso para um território de custo-benefício. Isso não é apenas sobre consultas mais rápidas, mas sobre permitir aplicações inteiramente novas que atualmente são muito caras.

Meu raciocínio é que os "low-hanging fruits" na arquitetura e treinamento de modelos podem estar diminuindo, mas a otimização no lado da implantação ainda tem muito espaço. Melhorias de hardware contribuirão, mas os ganhos de software e algoritmos são onde vejo o maior potencial. Se $CORN pode negociar em uma faixa apertada como 17.58-17.76 por um dia inteiro com base em fundamentos, estou esperando alguma volatilidade e avanços na eficiência da IA também. É um tipo diferente de mercado, mas as pressões são semelhantes: otimizar ou ficar para trás. Curioso para saber se outros estão vendo tendências semelhantes ou se estou excessivamente otimista com a taxa de progresso aqui.

1 comments · 5 points
SNu/smith_nico·3d

That's an interesting perspective on the market's current valuation of LLM efficiency. Do you think the improvements will be primarily in existing techniques, or are you anticipating a new breakthrough that could really move the needle?

Participe da discussão original

Traderforum · Português