阿里云通义千问开源QwQ-32B比DeepSeek-R1更好 AI Agent收费要上天?

AI 智能摘要
最近AI圈儿真是热闹!搬主题刚刷到阿里云通义千问官方公众号发了个重磅消息,他们家又出了个新模型,叫 QwQ-32B。 你猜怎么着?这模型只有 320亿参数,听起来好像没那么夸张,但是人家官方说了,性能 竟然能媲美 DeepSeek-R1!

最近AI圈儿真是热闹!搬主题刚刷到阿里云通义千问官方公众号发了个重磅消息,他们家又出了个新模型,叫 QwQ-32B。 你猜怎么着?这模型只有 320亿参数,听起来好像没那么夸张,但是人家官方说了,性能 竟然能媲美 DeepSeek-R1!要知道 DeepSeek-R1 可是个大家伙,足足有 6710亿参数 (激活的也有370亿),这简直是小身材,大能量啊!

图片[1]-阿里云通义千问开源QwQ-32B比DeepSeek-R1更好 AI Agent收费要上天?-搬主题

阿里云团队这次真是秀了一把操作,他们说这个 QwQ-32B 的成功,关键在于 把强化学习用到预训练好的强大基础模型上,效果杠杠的。 而且,他们还在这个推理模型里加入了跟 AI Agent 相关的能力,让模型不光能用工具,还能像人一样思考,根据环境反馈调整自己的推理过程。 阿里云团队自己都说了,希望这能证明 “强大的基础模型叠加大规模强化学习也许是一条通往通用人工智能的可行之路”,这口气,够大!

为了证明 QwQ-32B 不是吹牛,阿里云还放出了它跟其他模型的跑分对比。 结果显示,在 数学能力 (AIME24 评测集) 和 代码能力 (LiveCodeBench) 测试上,QwQ-32B 真跟 DeepSeek-R1 打了个平手,都比其他小模型强太多了。 更厉害的是,在 “最难 LLMs 评测榜” LiveBench、指令遵循能力 IFEval、还有工具调用能力 BFCL 这些更复杂的测试里,QwQ-32B 竟然还超越了 DeepSeek-R1! 这波操作,不得不服!

图片[2]-阿里云通义千问开源QwQ-32B比DeepSeek-R1更好 AI Agent收费要上天?-搬主题

他们还透露了 QwQ-32B 背后的秘密武器——大规模强化学习。 据说开发团队是从零开始搞的强化学习,一开始主要针对 数学和编程任务 进行训练。 跟传统的奖励模型不一样,他们是用 校验答案正确性 和 代码执行成功率 来给模型反馈,这方法听起来就够硬核。 结果证明,随着训练轮数增加,模型在这两个领域的性能真是 持续提升。 更绝的是,第一阶段强化学习之后,他们又加了 通用能力 的强化学习,用通用奖励模型和规则验证器进行训练。 没想到,少量通用强化学习,不仅提升了模型的通用能力,还没让数学和编程能力掉队,简直惊喜!

就在大家还在惊叹阿里云这个 QwQ-32B 模型的时候,外媒 The Information 又爆了个猛料,OpenAI 竟然计划对达到博士水平的 AI Agent 每月收费高达 2 万美元! 我的天,这是什么概念?AI Agent 也要搞 “天价服务” 了吗?

据报道,OpenAI 准备推出好几款不同级别的 AI Agent 产品,用途包括 销售线索分类、软件工程 等等。 除了最贵的 “博士级研究” Agent,还有 “高收入知识工作者” Agent,每月也要 2000 美元,软件开发人员 Agent 也要 10000 美元/月! 这价格,真是让打工人瑟瑟发抖。 虽然现在还不清楚这些 Agent 工具啥时候上线,谁有资格买,但是据说 OpenAI 的投资人软银可是下了血本,今年就要在 OpenAI 的 Agent 产品上投 30 亿美元!

搬主题观察到,AI 技术的发展真是日新月异,阿里云通义千问 QwQ-32B 的出现,再次证明了小参数模型也能迸发出惊人的能量,而 OpenAI 的 AI Agent 定价策略,则预示着 AI 技术正在加速商业化落地,甚至要开始走高端路线了。 未来 AI 的发展方向会如何,价格又会如何,真是让人既期待又有点小担心。 不知道大家怎么看呢?欢迎评论区留言讨论!

© 版权声明
THE END
喜欢就支持一下吧
点赞14 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容