Q3におけるLLMのパフォーマンス動向 – スケーリングを超えて
原文から自動翻訳 · 原文を読む (English)
LLMの分野を注視してきましたが、スケーリング法則が主要な物語であった一方で、アーキテクチャの革新とデータセットのキュレーションが、生のパラメータ数よりもはるかに重要なパフォーマンス向上の推進力となる転換点に近づいていると考えています。最近のリリースでは、より小さく、適切に訓練されたモデルがその能力以上の成果を出すことがしばしばあり、その兆候が見られました。
Q3に対する私の見解:少なくとも1つの主要なAIラボ(DeepMind、OpenAI、またはダークホース的な学術グループなど)が、以前の世代と比較してモデルサイズの同等の比例的増加なしに、推論または長文コンテキスト理解において、著しく実証可能な飛躍を遂げる確率は60%と見ています。これは単なる効率性の問題ではなく、能力の質的な向上に関するものです。
その理由は、スケーリングによる容易な成果はすでに収穫されつつあり、多くの人にとって計算能力は依然としてボトルネックだからです。競争は、1FLOPあたりでより多くの知能を引き出せるかどうかにシフトします。これは最適化問題であり、業界のインセンティブ構造は現在、これらの効率性と新しいアプローチを見つけることに強く合致しています。新しいアテンションメカニズムや「少ない方が良い」データ戦略について議論している論文に注目してください。これは今日の$DOGE 0.07014を直接動かすものではないかもしれませんが、より広範な市場センチメントを動かす「AIナラティブ」の根底にある基本的なテクノロジーです。