แนวโน้มประสิทธิภาพของ LLM ในไตรมาส 3 - เหนือกว่าการขยายขนาด
แปลอัตโนมัติจากต้นฉบับ · อ่านต้นฉบับ (English)
ติดตามพื้นที่ LLM อย่างใกล้ชิด และในขณะที่กฎการขยายขนาดเป็นเรื่องราวที่โดดเด่น ผมคิดว่าเรากำลังเข้าใกล้จุดเปลี่ยนที่นวัตกรรมทางสถาปัตยกรรมและการจัดการชุดข้อมูลจะกลายเป็นปัจจัยสำคัญในการเพิ่มประสิทธิภาพมากกว่าจำนวนพารามิเตอร์ดิบ เราเห็นสัญญาณบางอย่างนี้ในการเปิดตัวล่าสุดที่โมเดลขนาดเล็กที่ได้รับการฝึกฝนมาอย่างดีมักจะสามารถทำผลงานได้ดีเกินคาด
มุมมองของผมสำหรับไตรมาส 3: ผมให้ความน่าจะเป็น 60% ที่ห้องปฏิบัติการ AI หลักอย่างน้อยหนึ่งแห่ง (เช่น DeepMind, OpenAI หรือกลุ่มนักวิชาการม้ามืด) จะแสดงให้เห็นถึงความก้าวหน้าอย่างมีนัยสำคัญและเป็นรูปธรรมในการให้เหตุผลหรือความเข้าใจในบริบทที่ยาวนาน โดยไม่มี การเพิ่มขึ้นของขนาดโมเดลที่เทียบเท่ากันเมื่อเทียบกับรุ่นก่อนหน้า นี่ไม่ใช่แค่เรื่องของประสิทธิภาพเท่านั้น แต่ยังเป็นเรื่องของการปรับปรุงคุณภาพของความสามารถอีกด้วย
เหตุผลก็คือผลไม้ที่เก็บง่ายจากการขยายขนาดกำลังถูกเก็บไปแล้ว และการประมวลผลยังคงเป็นคอขวดสำหรับหลายๆ คน การแข่งขันเปลี่ยนไปสู่ผู้ที่สามารถดึงข้อมูลอัจฉริยะได้มากขึ้นต่อ FLOP มันเป็นปัญหาการเพิ่มประสิทธิภาพ และโครงสร้างสิ่งจูงใจในอุตสาหกรรมตอนนี้สอดคล้องอย่างยิ่งกับการค้นหาประสิทธิภาพและแนวทางใหม่ๆ เหล่านั้น จับตาดูเอกสารที่พูดถึงกลไกความสนใจใหม่ๆ หรือกลยุทธ์ข้อมูลแบบ 'น้อยแต่มาก' สิ่งนี้อาจไม่ได้ส่งผลโดยตรงต่อ $DOGE 0.07014 ในวันนี้ แต่มันคือเทคโนโลยีพื้นฐานที่อยู่เบื้องหลัง 'เรื่องราว AI' ที่ขับเคลื่อนความเชื่อมั่นของตลาดในวงกว้าง