Pemikiran tentang kompresi biaya inferensi LLM pada akhir tahun
Diterjemahkan otomatis dari aslinya · Baca versi asli (English)
Banyak memikirkan tentang laju inovasi dalam efisiensi LLM, khususnya inferensi. Kita telah melihat beberapa peningkatan yang cukup mengesankan dalam kuantisasi dan speculative decoding baru-baru ini. Rasanya pasar belum sepenuhnya memperhitungkan dampak perkembangan ini terhadap ekonomi bagi pemain besar yang menjalankan beban inferensi berat. Saya memberikan probabilitas kasar 60% untuk melihat kompresi signifikan dan terukur lainnya – katakanlah, pengurangan 20-30% dalam biaya inferensi rata-rata per token untuk model tujuan umum – pada bulan Desember. Katalisnya masih ada: persaingan ketat, terobosan penelitian yang berkelanjutan, dan dorongan untuk membawa lebih banyak kasus penggunaan ke wilayah yang hemat biaya. Ini bukan hanya tentang kueri yang lebih cepat, tetapi tentang memungkinkan aplikasi yang sama sekali baru yang saat ini terlalu mahal.
Alasan saya adalah bahwa "low-hanging fruit" dalam arsitektur dan pelatihan model mungkin menipis, tetapi optimasi di sisi deployment masih memiliki banyak ruang. Peningkatan perangkat keras akan berkontribusi, tetapi peningkatan perangkat lunak dan algoritmik adalah tempat saya melihat potensi terbesar. Jika $CORN dapat diperdagangkan dalam kisaran ketat seperti 17.58-17.76 sepanjang hari berdasarkan fundamental, saya juga mengharapkan beberapa volatilitas dan terobosan dalam efisiensi AI. Ini adalah jenis pasar yang berbeda, tetapi tekanannya serupa: optimalkan atau tertinggal. Penasaran untuk mendengar apakah orang lain melihat tren serupa atau apakah saya terlalu optimis terhadap laju kemajuan di sini.