Story
谷歌发布Gemini 4 Argon人工智能模型,盘后股价上涨

Summary
谷歌发布了其下一代旗舰人工智能模型 Gemini 4 Argon,并公布了基准测试数据,显示其在多个领域超越了主要竞争对手。消息公布后,谷歌股价在盘后交易中上涨了约 2%。
谷歌周三发布了其下一代旗舰人工智能模型 Gemini 4 Argon,此举推动其母公司 Alphabet (GOOGL) 的股价在盘后交易中上涨约 2%。此前数周,市场对 Argon 的期待已久,此次发布标志着这款新模型将直接与 OpenAI 和 Anthropic 等领先系统展开竞争。
新功能预览
谷歌首席执行官桑达尔·皮查伊 (Sundar Pichai) 在社交媒体平台 X 上发文,介绍 Argon 模型,称其在软件工程、网络防御和其他高级工作流程等复杂任务中展现了“前沿性能”。目前,Argon 的发布范围有限,路透社报道称,Argon 最初仅提供给部分网络安全合作伙伴。
谷歌尚未公布该模型面向公众的发布时间表。此前,一位公司高管曾表示,Argon 的某个版本将“尽快”发布,此次发布也算是提前展示了该系统的部分功能。
竞争基准测试结果
谷歌发布了一系列基准测试结果,显示 Argon 在大多数测试中都领先于其主要竞争对手,包括 OpenAI 的 GPT-6 Astra 和 Anthropic 的 Claude Opus 5.5。虽然结果并非完全碾压,但 Argon 展现出了显著的优势。
谷歌发布的关键性能指标包括:
Ad- Vals Index: Argon 得分 68.9%,而 Claude Opus 5.5 和 GPT-6 Astra 的得分分别为 67.0% 和 63.1%。
- Coding: 该模型在 DeepSWE v1.1 和 Vibe Code Bench 测试中均名列前茅,得分分别为 77.9% 和 91.9%。
- 长上下文: Argon 展现出显著优势,在 GraphWalks 测试中,使用多达 128,000 个 token 时准确率高达 99.7%,在多达 100 万个 token 的测试中准确率也达到了 84.2%。
- 复杂推理: Argon 在 Agent’s Last Exam 基准测试中得分 39.5%,高于 GPT-6 Astra 的 34.2%。
在一些单独的测试中,竞争对手的表现优于 Argon,其中 GPT-6 Astra 在 FrontierSWE v2 测试中领先,而 Claude Opus 5.5 在 Terminal-bench 4.0 测试中取得了最高分。
市场背景和展望
在经历了产品延期之后,谷歌推出 Argon 是其在快速发展的 AI 领域保持竞争优势的关键一步。Argon 的出色基准测试表现旨在表明谷歌有能力在最高水平的竞争中脱颖而出。
然而,这些基准测试结果出炉之际,人们对该模型在实际应用中的性能仍存有疑问。彭博社近期援引知情人士的消息报道称,尽管 Gemini 4 在行业基准测试中表现出色,但在内部实际应用中却不尽如人意。谷歌对此予以反驳,并强调其内部使用 Argon 模型处理编码和数据中心优化等复杂任务。