谷歌Gemini 4突然发布!RSI加持,GPT和Opus都让让

价格只有Astra一半

谷歌Gemini 4突然发布!RSI加持,GPT和Opus都让让 – 量子位

首页

资讯

智能车

智库

活动

MEET大会

AIGC

扫码关注量子位

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

谷歌Gemini 4突然发布!RSI加持,GPT和Opus都让让

鹭羽

2026-10-01

23:02:14

来源:

量子位

价格只有Astra一半

鹭羽 发自 凹非寺

量子位 | 公众号QbitAI

哎呦喂,谷歌终于也是蹬起来了。。。

假期第一天,谷歌携

Gemini 4 Argon

空降多榜单第一。

拳打Opus 5.5,脚踢GPT-6 Astra。

更夸张的还在后头,单项任务成本最低可至

1.99美元

,直接是Astra费用砍半。

最高百万Token输出上限

,面向编程、金融和法律等复杂工作流,而且划重点,网络安全防御能力超牛掰。

这波等等党要赢麻了。

不过吧,咱普通用户现在只可远观,暂时还吃不上。

Gemini 4 Argon目前只开放给部分经过筛选的网络安全团队使用,其它订阅用户得一步步来。

倒是谷歌内部对新一代旗舰模型的态度还挺有意思的。

劈柴哥、哈萨比斯还有接班人Koray Kavukcuoglu,纷纷一键三连为其站台:

谷歌is back!

DeepMind研究员Zirui Wang发帖直言:

RSI来了!

我已做无可做,是时候追逐我的咖啡师梦想了:)

讲真?

轮到你了,谷歌

全体起立!咱盼星星盼月亮的

Gemini 4

,它终于来了。

仔细数一数,距离谷歌上一代旗舰模型发布都快一年了,哪吒都没这么难产。

这一年OpenAI、Anthropic是追着谷歌砍啊,放假前一周还连发Opus 5.5、Sonnet 5.5、GPT-6.1 Sol逼宫。

你说谷歌能不急吗,新型号

Argon

火速上岸。

先看跑分情况,

清一色的性能领跑

。

Argon在衡量长期软件工程任务的DeepSWE v1.1上拿到77.9%,高于Claude Opus 5.5的74.2%和GPT-6 Astra的74.1%。

网络安全漏洞修复测试CWE-bench v1则拿到68%,和GPT-6 Astra

并列第一

。

Argon以68.90%登顶Vals Index榜首,较Gemini 3.8 Flash实现大幅提升。

尤其是

RSI指数

一跃第四,超越了GPT-6 Astra。

Gemini 4 Argon在另外的第三方评测中也不遑多让。

文本领域,Argon在代码编写、高难度提示词、指令遵循、长查询以及创意写作赛道优势显著,以1525分位居

Text Arena第一

。

在评测网页开发的

Code Arena中排名第八

,较Gemini 3.8 Flash High提升了21个名次,但依旧稍逊于Claude和GPT最新模型。

Artificial Analysis测评中,Argon和GPT-6 Astra旗鼓相当,高于GPT-6.1 Sol一分,提升主要来自于

更少的幻觉

和

更强的智能体能力

。

但在价格上,Argon相比Astra优势明显。

优惠期间Argon单题成本约

低四成

,每百万输入Token为2美元、输出Token为10美元,目前是最具性价比的模型之一。

在具体工作中,Argon也更倾向于处理复杂且长期的深度推理任务,比如软件工程、企业专业知识梳理以及网络安全防御等。

模型的

百万Token输出

上限,就是为这种长任务准备的,它能给模型更多连续工作的余地和充足的推理深度。

以谷歌内部使用情况为例,其中Argon在谷歌各数据中心自主识别并落地内存优化方案,待方案全面部署后,预计可释放超300 TiB内存。

另一个案例中,Argon Agent围绕视频解码器的Rust移植版本,反复实验并替换了3.2万行SIMD代码,最终版本运行速度达到原Rust移植版的2.7倍。

官方还重点强调了Argon的

防御性网络安全

优势。

它能够自主发现、验证并修补20多种语言的关键软件漏洞,在Wiz内部黑箱渗透测试中,模型可以在无源代码下实时分析网络系统,高效发现攻击面、识别漏洞以及生成概念验证证据。

为了防止滥用,Argon首批进入的是谷歌的Fairwind计划,面向经过审核的网络安全防御方。

对受信任的防御团队,谷歌会放开针对网络安全任务的部分限制,Argon将帮助防守方补洞,以及用来寻找攻击入口。

One More Thing

不过嘴上说说得了,Argon实际跑起来怎么样,还得打个问号。

毕竟咱普罗大众还没用上啊喂。。。

有小道消息透露,谷歌内部员工对Gemini 4

并不完全看好

。

一些接触过Gemini 4的员工认为,模型在实际编程任务中并没有跑分那么亮眼,网页和应用的前端界面设计仍是短板,甚至存在过度刷榜的嫌疑。

然而另一名熟悉开发工作的员工则表示,内部普遍认为Gemini 4已达到前沿水平。谷歌也回应称,说它编程表现不佳并不准确。

总之模型到底咋样,还有待观察。

所幸的是,

谷歌终于回到了牌桌之上

。

参考链接:

[1]

https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/

[2]

https://www.bloomberg.com/news/articles/2026-09-30/google-grapples-with-employee-skepticism-about-new-gemini-model

[3]

https://x.com/MrZiruiWang/status/2105388591644131582

[4]

https://x.com/arena/status/2105394855644139908

[5]

https://x.com/ArtificialAnlys/status/2105392625788637299

版权所有,未经授权不得以任何形式转载及使用,违者必究。

Gemini

谷歌

鹭羽

何恺明团队新作:看猫片就能学会ARC挑战

2026-10-01

Qwen一号位定了!刘大一恒接棒

2026-09-23

通用能力不打折,空间具身智能断层领先!ZDTaichu5.0-9B国产开源,跻身全球多模态第一梯队

2026-09-16

今年外滩最特别Agent:能干活,能陪聊,还会朋友圈拉黑你

2026-09-13

扫码分享至朋友圈

相关阅读

谷歌裁员细节曝光:开源主管被裁,61岁程序员在线求职,有人60天内找不到工作将被遣返

员工太贵,公司扛不住

白交

2023-01-29

裁员

谷歌

谷歌IMO金牌模型可以用了!推理性能秒了o3、Grok 4

每月只要1800元

十三

2025-08-02

DeepMind

Gemini

Gemini 2.5 Deep Think

陶哲轩DeepMind梦幻联动,最强通用科学Agent来了!一口气解决芯片设计、矩阵乘法和300年几何难题

Nature:令人惊叹

白交

2025-05-15

Nature

谷歌

谷歌最强具身大脑发布!波士顿机器狗瞬间人模人样

Gemini Robotics主打空间推理的第三代模型。

henry

2026-04-17

Gemini

具身智能

京东与谷歌电商项目曝光:给新平台Google Shopping提供商户

栗子

2019-08-07

京东

谷歌

马斯克感叹硅谷AI春招太疯狂!百万美元年薪随便开,小扎一线当猎头,谷歌创始人返场抢人

硅谷AI人才争夺进入白热化

鱼羊

2024-04-06

Meta

硅谷

谷歌

热门文章

PCIe显卡被低估了!内核补齐+通信重构,DeepSeek推理吞吐翻近7倍

2026-09-24

别人忙着卷Code,Kimi抽身反打浏览器插件:网页操作一秒变Skill

2026-09-25

出海Agent“小元AI”入驻腾讯WorkBuddy:找买家写开发信谈生意

2026-09-24

亮出“中国最强AI芯片”还不够,平头哥又甩出一手开源

2026-09-25

GPT-6之后,具身智能走向何方?诺因发布GLOW技术报告,给出机器人“一教就会”的答案

2026-09-24

关于量子位

加入我们

寻求报道

商务合作

扫码关注量子位

追踪人工智能新趋势,报道科技行业新突破

量子位 QbitAI 版权所有©北京极客伙伴科技有限公司

京ICP备17005886号-1


本文来源:量子位