谷歌Gemini 3.1 Flash-Lite发布 首字响应提速2.5倍

AI 智能摘要
谷歌推出的全新轻量级AI模型Gemini 3.1 Flash-Lite,主打的就是“快”和“省”,成为该系列中速度最快、成本最低的选择。这次的价格门槛大幅降低,每百万输入Tokens仅需0.25美元,输出Tokens则为1.50美元,对高频调用API的开发者和初创企业极具吸引力。别看它轻量,性能却相当硬核:响应速度比上一代暴涨2.5倍,在Arena.ai和GPQA等硬核测试中表现亮眼,部分指标甚至超越了前代大哥。更值得关注的是其创新的“思考层级”功能,开发者可以根据任务需求灵活调整AI的思考深度——从快速处理翻译、内容审核等基础任务,到深层推理生成界面或构建数据看板,都能游刃有余。对于追求高效、低成本AI应用的企业和开发者来说,这款兼顾速度、成本与可控推理能力的新模型,无疑是一个值得重点关注的选项。

谷歌昨天的动作可不小,直接甩出了全新的轻量级AI模型:Gemini 3.1 Flash-Lite。这次谷歌算是把“快”和“省”这两个字给玩明白了,直接定位为Gemini 3系列里速度最快、成本最低的那个选择。

图片[1]-谷歌Gemini 3.1 Flash-Lite发布 首字响应提速2.5倍-搬主题

目前,开发者已经能通过Google AI Studio里的Gemini API拿到预览版,企业用户也可以在Vertex AI平台上直接开整。

价格屠夫来了,门槛直接拉低

为了让更多人能用得起大模型,谷歌这次把价格压到了一个相当有诚意的水平。每百万输入Tokens收费仅需0.25美元,输出Tokens则是1.50美元。说白了,这个价格对那些高频调用API的开发者和初创企业来说,绝对是个极具诱惑力的选项。

图片[2]-谷歌Gemini 3.1 Flash-Lite发布 首字响应提速2.5倍-搬主题

别看它叫“Lite”,性能上却是一点没妥协。根据Artificial Analysis的数据,这哥们儿比上一代2.5 Flash强多了。首字响应速度直接暴涨2.5倍,整体输出速度也提了45%。这种极致的低延迟,就是为了那些需要实时交互的应用场景量身定做的。

越级挑战的硬核实力

在核心能力上,3.1 Flash-Lite的表现甚至有点“犯规”。在Arena.ai排行榜上,它直接拿到了1432分的Elo得分。到了硬核测试环节,比如GPQA Diamond测试得分高达86.9%,MMMU Pro测试也有76.8%。甚至在多项指标上,它直接把上一代大哥Gemini 2.5 Flash给压下去了。

图片[3]-谷歌Gemini 3.1 Flash-Lite发布 首字响应提速2.5倍-搬主题

创新的“思考层级”:灵活掌控AI大脑

搬主题觉得这次最有意思的更新,其实是那个“思考层级(thinking levels)”功能。

谷歌给了开发者一个控制AI“深度”的开关:

  • 省钱省力版:如果是处理翻译、内容审核这种基础且量大的任务,你可以把思考深度调低,追求极致的响应效率。
  • 深度推理版:要是遇到生成界面、构建数据看板或者复杂的逻辑模拟,你就能调高思考层级,逼着模型开启“深思熟虑”模式,解决复杂难题。

像Latitude、Cartwheel这些早期的企业用户已经在用它干活了。反馈回来的消息是,这模型既有大模型的精准度,处理效率还高得惊人。对于开发者来说,这种可控的推理能力,无疑是构建复杂业务逻辑时的利器。如果你正愁AI应用成本太高或者响应太慢,这个新模型倒是值得重点关注一下。

© 版权声明
THE END
喜欢就支持一下吧
点赞11 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容