谷歌推出 Gemini 4 Argon 旗舰 AI 模型,消息称其实战性能遭员工质疑
彭博社报道称,Alphabet 旗下的谷歌已开始逐步推出备受关注的旗舰人工智能模型 Gemini 4 Argon,但公司内部对该模型在代码编写等核心领域的实际表现仍存在疑问。
当地时间周三,谷歌向一小批经过筛选的网络安全合作伙伴开放了该模型,并表示在完成更多测试后会扩大开放范围,优先面向付费订阅用户。谷歌称,Gemini 4 在多项基准测试中取得了靠前成绩,其中一项安全能力测试甚至超越了 OpenAI 的 Astra 模型。
然而,部分内部员工认为这些评测指标无法反映全部情况。几位直接参与项目的知情人士透露,尽管 Gemini 4 在广泛使用的基准测试中表现不错,但当谷歌员工实际用它工作时,效果却不理想。这些不愿具名的人士称,该模型在处理某些代码任务时会遇到困难。
消息发布后,Alphabet 盘后股价上涨约 1.7%。但在常规交易日临近收盘时,随着彭博社报道员工质疑,周三早些时候的涨幅出现回落。
近期谷歌一直努力研发模型,以与 OpenAI 和 Anthropic 竞争。知情人士称,公司原本计划在六月发布另一版本 Gemini 3.5 Pro,但后来放弃了该开发工作。
谷歌方面表示,关于 Gemini 4 在代码等领域表现不佳的说法不准确。公司引导彭博社提问至谷歌 DeepMind 负责人科拉伊·卡武库奥卢上周的表态,他当时称对模型性能感到鼓舞。
“我对这支团队充满信心。”卡武库奥卢在《The Information》主办的会议上说,“在我看来,我们将持续站在技术前沿,这是确定的。”
谷歌内部对此看法不一。一部分员工认为,Anthropic 的 Fable 与 OpenAI 的 Astra 模型迭代速度已超过 Gemini。他们认为,即使 Gemini 4 发挥最佳,仍在部分领域落后于竞品。另一些员工则认为,这款即将上线的新版本已赶上领先的人工智能实验室。
一名熟悉模型研发的谷歌员工表示,公司内部已“形成广泛共识”,认为 Gemini 4 处于行业前沿。该人士称,谷歌已对模型进行了严格测试,否认其难以应对现实中的复杂编码任务。
谷歌迫切需要 Gemini 4 成功。几乎所有谷歌产品都以该系列模型为底层支撑,包括主要盈利业务搜索页面的 AI 回答,以及地图、邮箱和 Chrome 浏览器。这些产品的用户规模均超过十亿,这是许多竞争对手不具备的分发优势。
但 OpenAI 与 Anthropic 已不再仅售卖模型,转而打造自有产品,包括编程智能体。如果谷歌拿不出顶尖的新一代模型,竞争对手将有机会说服消费者、开发者和企业,相信未来搜索与软件应搭建在对手平台上。
在回复彭博社时,谷歌表示,尽管上一代 Pro 模型在二月发布,但此后旗下 AI 产品仍保持增长,包括企业版 Gemini、面向用户的聊天机器人应用,以及谷歌搜索的 AI 模式,后两者用户已突破十亿。
去年 11 月,谷歌正式推出 Gemini 3。该模型收获好评,被视为追赶 OpenAI 与 Anthropic 的转折点。谷歌在五月开发者大会上公布 Gemini 3.5 Pro,并承诺次月发布,但知情人士称该项目已被搁置。
放弃该项目不仅阻碍谷歌 AI 发展规划,还可能付出高昂代价。彭博行业研究分析师曼迪普·辛格表示,训练此类大模型单次成本最高可达 4 亿美元(约合 26.87 亿元人民币),加上高薪研究人员人力投入,整体成本更高。
如今 Gemini 4 研发又遇难题。熟悉内部评估的人士透露,模型代码编写能力参差不齐。一位知情人士称,Gemini 不擅长前端设计,即决定应用与网页外观和交互的工作。这可能是严重挫折,因为谷歌在 AI 代码工具领域本就处于追赶位置。
此外,知情研发人员称该模型体量庞大。大型模型运行成本高,可能对谷歌利润造成压力。
业内专家表示,谷歌可能陷入行业通病:过度看重基准测试得分,即“基准跑分内卷”。工程师更关注刷分而非开发实用产品。各实验室易出现此倾向,因为客户常依靠基准分数评判模型。两位熟悉该模型的人士称,Gemini 4 似乎也受此影响。
AI 初创企业 Surge AI 创始人埃德温·陈指出,若一味依赖基准测试,实验室会倾向于针对特定编程语言优化,而非开发体验良好的应用。
“可以打个比方:‘没错,我的孩子 SAT 分数很高。’但 SAT 高分不等于实际能力。”埃德温·陈说,“这是一个危害极大的问题。”
知情人士也指出,Gemini 4 仍有优势。该模型擅长解析文本以外输入,如从视频提取元数据,并在安全防护、网络安全方面表现突出,沟通表达清晰自然。
谷歌内部的挫败情绪已很明显。此前彭博社报道采访研究人员时,对方批评公司体系庞大、层级繁杂,试图将 AI 技术强行嵌入几乎所有产品线,不断变动的任务目标导致难以落实连贯策略。
与此同时,一批顶尖 AI 研究人员相继离开谷歌,包括传奇工程师杰夫·迪恩、诺贝尔奖得主约翰·江珀,以及诺阿姆·沙泽尔——他参与发明了本轮 AI 热潮的重要技术。今年八月,长期主管谷歌 AI 研究的德米斯·哈萨比斯转任董事长,将 DeepMind 日常运营交予副手科拉伊·卡武库奥卢。
谷歌周三说明,Gemini 4 面向软件工程、金融、法律和网络安全领域时长较长、复杂度高的工作任务设计。该模型相比前代可生成更长回复,单次输出最高达一百万词元,约七十五万个单词。在谷歌奋力追赶时,竞争对手仍在高速推进。尽管有观点认为部分前沿模型研发会放缓,但本月早些时候,Meta 发布了 AI 智能体 Muse,可独立完成网购、预约等事务,上线后迅速登上应用下载榜单前列。如果用户想体验前沿 AI 技术,可通过皇冠娱乐APP下载获取更多信息。