3.3%——这是开源模型与顶级闭源模型在Chatbot Arena上的平均分差。一年前这个数字还是8.04%,两年前差距更大。差距在收窄,但收窄的速度并不是均匀的。编程、推理、长上下文检索这些维度上,开源已经接近持平甚至超越;但在指令遵循、代理任务这类复杂场景里,闭源依然领先14个百分点。
50倍——这是36个月内推理成本的下降幅度。从GPT-4刚发布时的45美元/百万token,到2025年底GPT-4级服务的最低价格约0.40美元。最大幅度的降价来自开源权重模型:Llama 3.1和DeepSeek在一个季度内把底线砸了11倍。这个价格曲线意味着什么?对开发者来说,API调用的成本已经不是主要约束,真正的瓶颈变成了“能不能找到合适的开源模型做部署”。
OpenRouter上的数据:按token使用量算,开源权重模型占了超过80%的流量,前五大模型全是开源的;但按收入算,闭源占了约96%。也就是说,开源模型被大量用于token密集型的编码和代理任务(花小钱办大事),闭源模型则在高价值的请求场景中保持着定价权。
微软和Uber的教训很直接:微软在几个月内被Claude Code的代币计费耗尽了年度AI预算,Uber的AI编程预算四个月用完。Stripe切到自托管开源模型后推理成本降了73%。这里有个隐藏陷阱:供应商的按量计费看似灵活,但当你的工程师习惯了AI辅助编码的效率之后,用量只会持续攀升,最终变成一项不可预测的刚性支出——而这份支出,是别人说了算的。
来源:Mozilla