Cloudflare 让决策模型打起了价格战

AI 智能摘要
Cloudflare今天直接把决策模型赛道卷爆了!全新多模态Clef-omni能处理音视频和图像,处理一段21秒视频只要1.5秒。Clef-flash价格更是腰斩再腰斩,每百万输入token仅0.038美元,堪称地板价。原版Clef在Workers AI上速度也全面狂飙,最快提升2倍。这波更新让AI智能体开发更快更省,决策模型看来真要自成一派了。
图片[1]-Cloudflare 让决策模型打起了价格战-搬主题

决策模型这赛道现在是彻底卷起来了!就在今天,Cloudflare 直接把三重大招打包放了出来,官方博客的标题也极其直白——“faster, cheaper, multimodal”(更快、更便宜、多模态)。

如果你平时关注 AI Agent 或者大模型轻量化落地,那这波更新绝对值得好好看一眼。

1. Clef-omni:决策模型终于吃上“多模态”了

这次更新里最重磅的,当属 Clef 系列迎来的首个多模态决策模型——Clef-omni。

它直接把音频、视频、图像和文本的全模态处理能力给补齐了。据了解,这个模型是以开源的 Qwen3-Omni-30B-A3B-Instruct(MoE 底座)为基础进行二次开发的。Cloudflare 挺聪明,直接把原本的 TTS(语音合成)组件给砍掉了,在冻结的 Qwen3 主干网络上用 LoRA 做了后训练,专门用来输出校准概率,而不是去生成一堆废话文本。

速度方面表现相当能打:

  • 文本输入延迟约 130ms
  • 图像输入约 150ms
  • 处理一条 21 秒的视频也只要约 1.5 秒

价格更是杀到疯:每百万输入 token 只要 0.15 美元。

图片[2]-Cloudflare 让决策模型打起了价格战-搬主题

2. Clef-flash:价格腰斩再腰斩,直接成“地板价”

除了多模态,大家最关心的价格战也来了。Clef-flash 的降价力度堪称简单粗暴:输入 token 的价格直接从每百万 0.09 美元暴降到 0.038 美元。

这个价格比前几天刚刷屏的 Jev 还要便宜,直接稳坐决策模型赛道的“价格最低档”。

当然,便宜归便宜,也是有代价的。托管版本的上下文窗口从之前的 64k 被砍到了 24k。不过 Cloudflare 给出的理由很理直气硬:后台数据显示,只有 0.24% 的请求会超过 24k 上下文,把这部分不常用的内存砍掉,就能把成本彻底打下来。如果你选择自己部署,Hugging Face 上的权重依然完全不受影响,依然保持 256k 的满血状态。

图片[3]-Cloudflare 让决策模型打起了价格战-搬主题

3. Workers AI 上的 Clef 本体:速度全面狂飙

除了新模型和降价,Cloudflare 还对原版 Clef 在 Workers AI 平台上进行了底层的速度优化:

  • 约 800 tokens 的请求延迟:从 262ms 降到 152ms(提速约 1.7 倍)
  • 约 3,400 tokens 的请求:从 616ms 降到 305ms(提速整整 2 倍)
  • 约 16,000 tokens 的大请求:从 2721ms 降到 1635ms(提速约 1.7 倍)

更重要的是,这些模型全部开源了权重,并且直接跑在 Cloudflare 自己的 Workers AI 上,开发者用起来相当省心。

站长点评:决策模型正在自成一派

把这三件事放一块看,意思已经不能再明显了。

现在整个 AI 圈的逻辑正在发生变化:像 TypeSafe 拿到了 75 亿美元的高额估值,微软也推出了专攻评分的 Decision-1,而 Cloudflare 则直接通过 Clef 在价格和部署自由度上掀起了血雨腥风。

从一开始,Clef 就是 Cloudflare 为自家庞大 Agent 生态准备的“大脑判断单元”。现在,Cloudflare 把这个判断单元打磨得更快、更便宜,还顺手塞进去了多模态眼睛和耳朵。正如业内此前的预判那样:“决策模型正在变成独立于传统 LLM 的全新赛道”,而这场关于效率与价格的明争暗斗,才刚刚拉开序幕。

© 版权声明
THE END
喜欢就支持一下吧
点赞7 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容