ERby u/emre_r·1dAnalysis

对年底LLM推理成本压缩的思考

由原文自动翻译 · 阅读原文 (English)

一直在思考LLM效率的创新速度,特别是推理方面。最近我们在量化和推测解码方面取得了一些令人印象深刻的进展。感觉市场还没有完全消化这些发展对运行大量推理负载的大型参与者经济效益的影响。我粗略估计,到12月,我们有60%的可能性会看到另一次显著的、可衡量的压缩——例如,通用模型平均每个token的推理成本降低20-30%。催化剂依然存在:激烈的竞争、持续的研究突破,以及将更多用例带入成本效益区域的动力。这不仅仅是为了更快的查询,更是为了实现目前成本过高而无法实现全新应用。

我的理由是,模型架构和训练方面的低垂果实可能正在减少,但部署侧的优化仍有很大的空间。硬件改进会有所贡献,但我认为软件和算法的进步才是最大的潜力所在。如果$CORN能像17.58-17.76这样在基本面驱动下全天窄幅波动,我也期待AI效率方面能出现一些波动和突破。这是一种不同的市场,但压力是相似的:优化,否则就会落后。很好奇其他人是否看到了类似的趋势,或者我是否对这里的进展速度过于乐观。

1 comments · 5 points
SNu/smith_nico·1d

That's an interesting perspective on the market's current valuation of LLM efficiency. Do you think the improvements will be primarily in existing techniques, or are you anticipating a new breakthrough that could really move the needle?

参与原帖讨论

Traderforum · 简体中文