0

谷歌发布Gemini3.6系列模型,Token消耗显著降低

2026.07.24 | 念乡人 | 20次围观
谷歌发布Gemini3.6系列模型,Token消耗显著降低
谷歌发布Gemini 3.6系列模型,Token消耗显著降低 谷歌近日正式推出了Gemini 3.6系列模型,这一更新并非简单的小版本迭代,而是在底层效率上做出了实打实的突破。最让开发者和企业用户兴奋的一点,是Token消耗的大幅下降——在同等输出质量下,调用成本能被压缩到原来的三分之一左右。 Token是大模型处理文本的基本单位,每一次API调用、每一次对话响应,背后都对应着真金白银的Token支出。对于需要频繁调用模型的企业来说,Token费用往往占到整体AI投入的大头。Gemini 3.6在这个环节动刀,显然是想把“用得起”这件事做到极致。 从技术层面来看,这次的效率提升主要源自三个方面。首先是模型架构层面的稀疏化改进。Gemini 3.6采用了更精细的注意力机制,在处理长文本时不必要再对每一个Token都做全量计算,而是自动识别关键语义位置做重点处理,无意义或者重复的信息会被跳过。这种“选择性关注”让相同上下文长度下实际参与运算的Token数量锐减。 其次是KV缓存的压缩优化。之前的模型在生成连续对话时,每多一轮对话,缓存中的历史Token信息就会成倍增长,导致后续响应越来越慢、成本越来越高。Gemini 3.6在缓存算法上做了重新设计,能把历史会话的Token表示压缩到原来的四分之一大小,同时保留对话上下文的一致性。这一改变尤其利好那些需要长链推理的场景,比如代码生成、合同审阅、多轮客服对话。 另外,谷歌还在Tokenizer(分词器)上下了功夫。新版分词器对中英文混合文本、代码符号、表格数据的编码效率更高,同样是“今天天气不错”这句话,Gemini 3.6比前代少用了接近20%的Token数。别小看这几个百分点的差距,在日均百万级请求的规模下,累加的效果非常可观。 对于开发者来说,最直观的感受是API账单变薄了。有内测用户反馈,相同任务量的内容生成任务,切换到Gemini 3.6后月均费用直接腰斩。而且这次降低Token消耗并没有牺牲响应速度或答案质量,在MMLU、HumanEval等基准测试上,3.6系列与前代持平,部分逻辑推理科目甚至略有提升。 当然,任何技术方案都有取舍。稀疏注意力机制对极端结构化的数据(比如庞大JSON、固定格式表格)可能会轻微降低召回精度,谷歌也保留了“全量注意力”模式供开发者手动切换。不过这并不妨碍Gemini 3.6成为现阶段性价比最优的大模型选择之一。 从行业视角看,这波操作很可能倒逼其他模型厂商跟进优化。Token成本一直是阻碍AI应用落地的门槛之一,谁能率先把单位价值压下来,谁就能在ToB市场抢得先机。谷歌选择在Gemini 3.6上做这件事,时机和力度都拿捏得不错,接下来就看实际商用反馈了。
版权声明

本文系作者授权念乡人发表,未经许可,不得转载。

标签列表