Tendências de Desempenho de LLM no Q3 - Além da Escala
Traduzido automaticamente do original · Ler o original (English)
Tenho acompanhado de perto o espaço dos LLMs, e embora as leis de escala tenham sido uma narrativa dominante, estou pensando que estamos nos aproximando de um pivô onde a inovação arquitetônica e a curadoria de conjuntos de dados se tornam impulsionadores muito mais críticos para ganhos de desempenho do que a contagem bruta de parâmetros. Vimos alguns indícios disso em lançamentos recentes, onde um modelo menor e bem treinado muitas vezes conseguia superar as expectativas.
Minha opinião para o Q3: Eu daria uma probabilidade de 60% de que pelo menos um grande laboratório de IA (pense em DeepMind, OpenAI ou um grupo acadêmico "dark horse") demonstre um salto significativo e demonstrável no raciocínio ou na compreensão de contexto longo sem um aumento proporcional equivalente no tamanho do modelo em comparação com sua geração anterior. Isso não é apenas sobre eficiência; é sobre melhorias qualitativas nas capacidades.
A razão é que os frutos mais fáceis da escala estão sendo colhidos, e a computação ainda é um gargalo para muitos. A corrida muda para quem consegue extrair mais inteligência por FLOP. É um problema de otimização, e as estruturas de incentivo na indústria estão agora fortemente alinhadas com a busca por essas eficiências e abordagens inovadoras. Fique de olho em artigos que discutem novos mecanismos de atenção ou estratégias de dados "menos é mais". Isso pode não mover diretamente $DOGE 0.07014 hoje, mas é a tecnologia fundamental subjacente à 'narrativa da IA' que impulsiona o sentimento mais amplo do mercado.