整理 | 郑丽媛
出品 | CSDN(ID:CSDNnews)
AI 江湖的“王座”,从来没有真正稳固过。
几个月前,谷歌凭借 Gemini 3 系列模型一度被认为重新找回了竞争优势;但如今,随着 OpenAI、Anthropic、Meta 等玩家持续发力,AI 赛道的格局正在快速变化。
近日,Meta 首席 AI 官、被称为公司“最高薪员工”的 Alexandr Wang,因一句简单却极具挑衅意味的话引起热议:“gemini who?(Gemini,谁啊?)”
这场口水战的背后,其实是一场 AI 巨头之间的公开较量——Meta 最新模型 Muse Spark 1.1 在一份模型排行榜中超过了谷歌刚发布的 Gemini 3.6 Flash,而 Alexandr Wang 则借机向这位老牌 AI 巨头“开了一枪”。
一时间,AI 圈再次掀起讨论:Meta,真的开始追上谷歌了吗?
一句“Gemini 谁啊?”,Alexandr Wang 向谷歌开炮
事情源于 X 用户 Tae Kim 分享的一份 AI 模型性能排行榜。
榜单引用了 Artificial Analysis Intelligence Index 的数据,对当前主流大模型进行了综合比较。其中,Anthropic 的 Claude Fable 5、OpenAI 的 GPT-5.6 等顶级模型仍处于领先位置,而 Meta 的 Muse Spark 1.1 则在部分关键能力测试中超过谷歌最新的 Gemini 3.6 Flash。
数据显示,Gemini 3.6 Flash 得分为 50,而 Muse Spark 1.1 凭借在推理能力、代码生成以及 Agent 任务执行方面的优势排名更高。
Tae Kim 在分享这份榜单的帖子时直接写道:“谷歌这么早就被 Alexandr Wang 击败,而 Meta 的新 AI 团队规模相比之下还很小,这对谷歌来说也太尴尬了。”
随后,Alexandr Wang 转发了该帖子,并只留下了一句话:
“gemini who?(Gemini,谁啊?)”
短短2 个单词,却火药味十足——毕竟,谷歌长期以来一直被认为是全球 AI 技术的重要玩家,而 Gemini 系列更是谷歌押注未来竞争的核心产品。
而 Alexandr Wang 也并不是普通的 AI 从业者。2025 年,Meta CEO 扎克伯格高调招募这位 Scale AI 创始人,并通过一笔约 150 亿美元规模的交易,将其纳入 Meta AI 战略核心。随后,Alexandr Wang 便被任命为 Meta 首席 AI 官,负责推动 Meta 的超级智能方向。
所以,从某种意义上来说,他的这句“gemini who?”,不仅是在嘲讽谷歌的模型,也是在宣告 Meta 新 AI 团队正在加速追赶。
Meta 的“新王牌”Muse Spark 1.1,并非没有争议
Alexandr Wang 此次敢于“喊话”谷歌,底气来自 Meta 最新推出的 AI 模型——Muse Spark 1.1。这是 Meta Superintelligence Labs 推出的多模态 AI 模型,也是 Meta 重新调整 AI 战略后的重要成果。
与传统聊天机器人不同,Muse Spark 的重点并不是简单回答问题,而是面向更加复杂的 Agent 任务。所谓 Agent,就是拥有一定自主执行能力的 AI 助手:用户提出目标后,模型不仅能生成文字,还可以规划步骤、调用工具、操作软件,并完成一系列任务。
Meta 表示,Muse Spark 1.1 在许多方向都进行了强化:多步骤推理、工具调用、电脑操作能力、编程任务以及多模态理解。官方还指出,该模型能更好地处理需要规划和协调多个外部应用与服务的个人 Agent 场景。
为此,Meta 还开放了新的 Meta Model API 公测,让开发者可以直接调用 Muse Spark 1.1。
不过,虽然 Meta 对 Muse Spark 1.1 给予了高度评价,但行业内也存在不同声音。例如,AI 研究员 François Chollet 此前曾公开批评 Muse Spark,认为它过度针对公开 Benchmark 进行优化,而在其他实际能力方面有所不足。
面对这一质疑,Alexandr Wang 并没有回避,而是回应称:Meta 很清楚 Muse Spark 在某些测试中存在不足,例如 ARC AGI 2 表现并不理想。这也体现出了 Meta 当前的一种策略:不追求所有指标全面领先,而是重点突破 Agent、代码和真实任务执行能力。
毕竟,随着大模型竞争进入下一阶段,单纯比拼聊天能力已经越来越难体现差距,真正决定其商业价值的,可能是“AI 能不能帮用户完成事情。”
Gemini 3.5 Pro 的持续延期,让谷歌开始显得“掉队”?
其实,在 Alexandr Wang 发布“gemini who?”的当天,谷歌刚发布了三款新 AI 模型:性能提升且成本降低的 Gemini 3.6 Flash、针对网络安全优化的 Gemini 3.5 Flash Cyber,以及面向 AI 智能体场景的 Gemini 3.5 Flash-Lite。
是的,Gemini 3.6 Flash 刚发布就在榜单中输给了 Muse Spark 1.1。
但据谷歌强调,其实 Gemini 3.6 Flash 在多个方向都进行了增强:
(1)代码能力提升
在 DeepSWE 测试中,Gemini 3.6 Flash 得分达到 49%,相比上一代 Gemini 3.5 Flash 的 37% 有明显提升。在机器学习研究任务测试 MLE Bench 中,成绩也从 49.7% 提升至 63.9%。
(2)Agent 和电脑操作能力增强
谷歌表示,Gemini 3.6 Flash 在 OSWorld-Verified 测试中的成绩从 78.4% 提升至 83%。同时,Computer Use 能力已作为客户端工具集成到 Gemini API 和 Gemini Enterprise 中,让模型可以更直接地参与电脑操作任务。
(3)知识工作能力增强
在 GDPval-AA v2 测试中,Gemini 3.6 Flash 达到 1421 分,高于上一代的 1349 分。还有部分企业客户反馈,新模型尤其擅长文档解析、图表理解、数据分析和自动生成报告。
不过,相比 Gemini 3.6 Flash 的发布,外界其实更关注谷歌另一款旗舰模型:Gemini 3.5 Pro。
按照此前规划,这款模型应该成为谷歌下一阶段挑战 OpenAI GPT 系列、Anthropic Claude 系列的重要产品——但目前,Gemini 3.5 Pro 的发布时间持续推迟,这也是此次 Alexandr Wang 对其进行“嘲讽”的一个重要原因。
除了 Alexandr Wang,OpenAI 技术团队成员 Thibault Sottiaux 也对谷歌的延期暗讽了一番。
此前,谷歌产品负责人 Logan Kilpatrick 在 X 上宣布,下一代旗舰模型 Gemini 4 已正式开始预训练,并称这是 Gemini 系列的下一个重要里程碑。对此,ThibaultSottiaux 回复道:“希望它有一天能训练完吧!”
诚然,最近几周 OpenAI 和 Anthropic陆续推出新一代旗舰模型,这让谷歌的延迟显得更加明显。例如,Raymond James 分析师 Josh Beck 就表示,Gemini 3.5 Pro 的延期,已经改变了市场对谷歌的看法:从过去的“领先者”,变成了“追赶者”。
不过,也有人认为,这种判断可能过于草率。
“谷歌是一家规模更大的公司,它的发展方式和竞争对手有所不同。”Moor Insights & Strategy 分析师 Anshel Sag 推测,既然谷歌提前预热 Gemini 4,某种程度上说明“他们手里已经有了更好的东西”。但他同时也指出,现在 AI 行业的发展速度非常快,并不是每一次模型升级都会带来真正意义上的突破。
而面对外界的各种讨论,截至目前谷歌尚未进行相关回应。
最后,或许正如 Anshel Sag 的判断:“现在就说谁被淘汰、谁赢了,还太早。”一次 Benchmark 排名变化,并不能决定最终胜负,今天是 Muse Spark 挑战 Gemini,明天可能又会出现新的黑马——唯一可以确定的是:AI “王座”正在变得越来越拥挤。
那么,在新一轮 AI 巨头混战中,你又看好哪家的 AI 模型呢?
参考链接:
https://www.businessinsider.com/rivals-mock-google-gemini-3-5-pro-delay-2026-7
https://timesofindia.indiatimes.com/technology/tech-news/metas-highest-paid-employee-alexandr-wang-has-forgotten-who-the-worlds-biggest-internet-company-is-says-who-/articleshow/132553769.cms
🌐 GOSIM SHENZHEN 2026 全球开源 AI 大会
10 月 16—17 日 ·📍 深圳
150+ 国内外讲师 · 2000+ 全球开发者 · Agentic AI
开源大模型 / 开源机器人 / 边缘智能体 / 智能体操作系统
Keynote + Workshop + Hackathon + AI Vision Forum
🎫 早鸟限时抢购中
👉 扫码购票,锁定你的 AI 盛会席位!