这AI圈子真是日新月异,稍微不留神就感觉要跟不上了!这不,就在周二,谷歌和OpenAI这两大巨头又前后脚放出了大招,看得搬主题是眼花缭乱。一边是谷歌家的新模型Gemini 2.5,号称学会了“三思而后行”;另一边,大家熟悉的ChatGPT也解锁了新技能,可以直接在聊天里捣鼓图片了!来,跟着搬主题一起看看这俩新玩意儿到底有啥名堂。
谷歌Gemini 2.5:让AI“琢磨琢磨”再说,靠谱不?
先说说谷歌这边。他们搞了个新系列的模型,叫Gemini 2.5。最大的噱头就是,这模型在回答你问题之前,会先“稍微琢磨琢磨”,搞个所谓的“推理”过程。听起来是不是有点像咱们人类思考问题?
![图片[1]-AI圈又“卷”起来了:谷歌Gemini学会“先想后说”,ChatGPT直接上手P图-搬主题](https://cdn.banzhuti.com/2025/03/20250326112808679.jpg)
打头阵的是Gemini 2.5 Pro Experimental。谷歌自己吹这是他们家目前最聪明的模型,还能处理图片、声音啥的(多模态嘛)。开发者现在就能在Google AI Studio里尝鲜了,如果你是掏了钱(每月20刀)用Gemini Advanced的会员,也能在App里体验到。
谷歌还放话了,以后他们家所有新AI模型,都得带上这种“琢磨”的本事。
“推理”这事儿,现在AI圈都挺上头
话说回来,让AI“先想后说”这事儿,也不是谷歌首创。自从去年OpenAI搞出个叫o1的模型后,大家就都在这方面较劲。现在像Anthropic、DeepSeek(国内的哦)、谷歌、还有马斯克的xAI,都有类似的模型。说白了,就是多花点时间和算力,让AI在给出答案前自己先检查检查、理理思路,特别是在搞数学题和写代码的时候,据说效果拔群。
很多人觉得,这种会“思考”的AI,以后搞不好能自己干很多活儿,变成那种能独立完成任务的“AI代理”。当然了,这么聪明的模型,用起来估计也更烧钱。
谷歌之前也试过类似的,但这次的Gemini 2.5,看架势是真想跟OpenAI的“o”系列掰掰手腕。
实战能力怎么样?谷歌自己挺有信心
谷歌放出了些测试数据,说Gemini 2.5 Pro在好几个项目上都比自家的老大哥和一些竞争对手强。尤其是在做那种看起来很炫的网页应用,还有写能自己跑起来的代码(代理式编码)方面,表现特别亮眼。
- 比如在一个叫Aider Polyglot的代码编辑测试里,Gemini 2.5 Pro拿了68.6%的分,把OpenAI、Anthropic和DeepSeek的尖子生都比下去了。
- 不过嘛,也不是全方位碾压。在另一个叫SWE-bench Verified的软件开发能力测试里,它得了63.8%,虽然赢了OpenAI的o3-mini和DeepSeek的R1,但还是输给了Anthropic家的Claude 3.7 Sonnet(人家拿了70.3%)。
- 还有一个挺有意思的测试叫Humanity’s Last Exam,里面全是网友们出的各种难题,数学、人文、科学啥都有。Gemini 2.5 Pro拿了18.8%的分,据说比大部分对手的旗舰模型都要好。
![图片[2]-AI圈又“卷”起来了:谷歌Gemini学会“先想后说”,ChatGPT直接上手P图-搬主题](https://cdn.banzhuti.com/2025/03/20250326112840709.webp)
一次能“吃”下整部《指环王》?
还有个亮点,Gemini 2.5 Pro一上来就能处理超长超长的信息,官方说法是100万token的上下文窗口。啥概念?大概相当于75万个英文单词,一口气能“读”完一整套《指环王》!而且谷歌说了,很快还要翻倍到200万token。这对于需要分析大量文档或者长代码的项目来说,简直是福音。
至于用这个模型得花多少钱(API价格),谷歌暂时卖了个关子,说后面几周再告诉大家。
![图片[3]-AI圈又“卷”起来了:谷歌Gemini学会“先想后说”,ChatGPT直接上手P图-搬主题](https://cdn.banzhuti.com/2025/03/20250326112844607.webp)
搬主题点评: 谷歌这Gemini 2.5让AI“先想后说”的路子是对的,毕竟谁也不想AI瞎说八道。特别是超长的上下文窗口,想象空间很大。不过,光说不练假把式,这“思考”能力到底有多靠谱,跑起来会不会慢吞吞,还有最终的价格香不香,这些都是开发者和用户最关心的。能不能真的挑战OpenAI的地位,还得看后续的实际表现和市场反应。
OpenAI不甘示弱:ChatGPT直接上手P图,还能改照片!
就在谷歌官宣的同一天,OpenAI的CEO山姆·奥特曼(Sam Altman)也出来搞事情了。他宣布给ChatGPT来了个“视觉大升级”——现在能直接用GPT-4o模型在聊天里原生地生成和修改图片了!
![图片[4]-AI圈又“卷”起来了:谷歌Gemini学会“先想后说”,ChatGPT直接上手P图-搬主题](https://cdn.banzhuti.com/2025/03/20250326112857168.webp)
要知道,GPT-4o本来就是ChatGPT背后的大脑,但之前它主要负责文字活儿,图片生成得靠另一个叫DALL-E 3的工具。现在好了,GPT-4o亲自下场,不用再拐弯抹角了。
![图片[5]-AI圈又“卷”起来了:谷歌Gemini学会“先想后说”,ChatGPT直接上手P图-搬主题](https://cdn.banzhuti.com/2025/03/20250326112917457.webp)
新P图功能香不香?谁能用?
奥特曼说,这个新功能已经在ChatGPT和他们那个做视频的AI工具Sora里上线了,不过目前只有掏了每月200刀的Pro会员能先用上。别急,OpenAI说了,很快Plus会员、免费用户,还有用他们API的开发者也能用上。
据说,用了GPT-4o来P图,会比之前的DALL-E 3稍微慢一点点,因为它会“想”得更仔细,目标是做出更准、细节更到位的图片。而且,它不光能从无到有画图,还能编辑你给它的图片,就算是照片里有人也没问题!想给照片换个背景?给前景加点东西?“修复绘画”(inpainting)?GPT-4o都能试试。
训练数据来源?老生常谈的版权问题
一说到AI生成图片,大家肯定关心它是拿啥“喂”大的。OpenAI跟《华尔街日报》透露,他们用了“公开可用的数据”,还有就是跟Shutterstock(一个大图库)这些公司合作搞到的专有数据来训练GPT-4o。
这训练数据嘛,一直是个敏感话题。一方面,这是AI公司的核心竞争力,谁也不想轻易亮底牌;另一方面,这里面牵扯到版权问题,搞不好就得吃官司,所以大家一般都说得含含糊糊。
OpenAI的首席运营官Brad Lightcap出来表态,说他们尊重艺术家的权利,有政策防止生成直接模仿在世艺术家风格的作品。他们还提供了一个表格,让创作者可以申请把自己的作品从训练库里删掉,也说会遵守网站不让爬虫抓取数据的设置。
有意思的是,就在不久前,谷歌那个Gemini 2.0 Flash模型的图像功能也火过一阵,但名声不太好。因为它没啥限制,被人发现能去掉图片水印,还能画出受版权保护的角色。不知道这次OpenAI的防护做得怎么样。
搬主题点评: ChatGPT这个原生P图功能,咱们搬主题觉得挺实用的!以后写文章配图、做设计草稿啥的,可能直接在ChatGPT里就能搞定一部分了,方便了不少。这无疑是把GPT-4o的多模态能力又往前推了一步,对Midjourney这些专门搞图片的AI工具来说,压力肯定更大了。不过,版权这根弦还是得绷紧,OpenAI虽然做了些承诺和措施,但能不能彻底解决问题,还得打个问号。毕竟,技术跑得再快,规矩也得跟上才行。
总结一下
总的来说,谷歌和OpenAI这波操作,一个往“深度思考”发展,一个在“多才多艺”上加码,都代表了现在AI发展的方向。这AI圈子真是越来越卷了,但也意味着咱们用户能用到的工具会越来越强大。接下来就看这两家谁能把新技术打磨得更好用、更安全、更让人离不开了。
























暂无评论内容