Gemini 3.6 Flash 系列:谷歌轻量级模型矩阵再扩张

谷歌一次性推出 Gemini 3.6 Flash、3.5 Flash-Lite、3.5 Flash Cyber 三款轻量级模型,覆盖高性价比推理、极致轻量与安全对抗场景,并悄然废弃了部分采样参数。
谷歌本周在官方博客一次性放出三款轻量级模型:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite 与 Gemini 3.5 Flash Cyber。它们共同把「高性价比推理」这个故事讲得更细——不再是单一的「大模型越强越好」,而是按延迟、成本、专项能力切分出不同档位,让开发者按场景挑模型。
Flash 仍定位为高吞吐、低延迟的主力推理档,适合对话、摘要、分类等大规模在线请求;Flash-Lite 进一步压缩体积与单价,面向对成本极度敏感、对质量容忍度更高的批量任务;Flash-Cyber 则是面向安全与对抗场景的专项变体,更强调在恶意输入、越狱尝试下的稳健性。三档并存的信号很明确:模型市场正在从「一个万能模型」走向「按工作负载选模型」。
图1:三款轻量级模型的定位与共性趋势
另一个值得开发者注意的变化是:在最新模型文档中,temperature、top_p、top_k 等采样参数被标记为已废弃并被忽略。这意味着过去靠调这些参数控制「随机度」的玩法,在新端点上不再生效——如果你的代码里还硬编码了采样超参,需要重新审视生成稳定性的来源(例如改用更确定的提示词工程或后处理)。
对工程团队而言,多档轻量模型的出现降低了「上 LLM」的门槛,但也抬高了路由与编排的复杂度:什么时候用 Flash,什么时候降级到 Lite,安全敏感链路是否切到 Cyber,都需要一套调度策略。这正呼应了当下 AI 编程工具把「模型选择」逐步下沉为基础设施能力的趋势。
图2:三款模型在成本—延迟空间中的大致位置
关联推荐
- Kimi K3 需求爆表停售:算力瓶颈下的供需博弈 — 看轻量模型需求背后的算力约束
- Bonsai 27B:27B 级 AI 模型首次在手机上运行 — 端侧轻量化的另一条路径
- GPT-5.6 递归自我改进:AI 开始自己训练自己 — 大模型自我演进的范式讨论
来源:Google Blog: Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber
评论 (0)
加载评论中…