谷歌Gemini 4突然发布!RSI加持,GPT和Opus都让让
价格只有Astra一半
谷歌Gemini 4突然发布!RSI加持,GPT和Opus都让让 – 量子位
首页
资讯
智能车
智库
活动
MEET大会
AIGC
扫码关注量子位
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">
谷歌Gemini 4突然发布!RSI加持,GPT和Opus都让让
鹭羽
2026-10-01
23:02:14
来源:
量子位
价格只有Astra一半
鹭羽 发自 凹非寺
量子位 | 公众号QbitAI
哎呦喂,谷歌终于也是蹬起来了。。。
假期第一天,谷歌携
Gemini 4 Argon
空降多榜单第一。
拳打Opus 5.5,脚踢GPT-6 Astra。
更夸张的还在后头,单项任务成本最低可至
1.99美元
,直接是Astra费用砍半。
最高百万Token输出上限
,面向编程、金融和法律等复杂工作流,而且划重点,网络安全防御能力超牛掰。
这波等等党要赢麻了。
不过吧,咱普通用户现在只可远观,暂时还吃不上。
Gemini 4 Argon目前只开放给部分经过筛选的网络安全团队使用,其它订阅用户得一步步来。
倒是谷歌内部对新一代旗舰模型的态度还挺有意思的。
劈柴哥、哈萨比斯还有接班人Koray Kavukcuoglu,纷纷一键三连为其站台:
谷歌is back!
DeepMind研究员Zirui Wang发帖直言:
RSI来了!
我已做无可做,是时候追逐我的咖啡师梦想了:)
讲真?
轮到你了,谷歌
全体起立!咱盼星星盼月亮的
Gemini 4
,它终于来了。
仔细数一数,距离谷歌上一代旗舰模型发布都快一年了,哪吒都没这么难产。
这一年OpenAI、Anthropic是追着谷歌砍啊,放假前一周还连发Opus 5.5、Sonnet 5.5、GPT-6.1 Sol逼宫。
你说谷歌能不急吗,新型号
Argon
火速上岸。
先看跑分情况,
清一色的性能领跑
。
Argon在衡量长期软件工程任务的DeepSWE v1.1上拿到77.9%,高于Claude Opus 5.5的74.2%和GPT-6 Astra的74.1%。
网络安全漏洞修复测试CWE-bench v1则拿到68%,和GPT-6 Astra
并列第一
。
Argon以68.90%登顶Vals Index榜首,较Gemini 3.8 Flash实现大幅提升。
尤其是
RSI指数
一跃第四,超越了GPT-6 Astra。
Gemini 4 Argon在另外的第三方评测中也不遑多让。
文本领域,Argon在代码编写、高难度提示词、指令遵循、长查询以及创意写作赛道优势显著,以1525分位居
Text Arena第一
。
在评测网页开发的
Code Arena中排名第八
,较Gemini 3.8 Flash High提升了21个名次,但依旧稍逊于Claude和GPT最新模型。
Artificial Analysis测评中,Argon和GPT-6 Astra旗鼓相当,高于GPT-6.1 Sol一分,提升主要来自于
更少的幻觉
和
更强的智能体能力
。
但在价格上,Argon相比Astra优势明显。
优惠期间Argon单题成本约
低四成
,每百万输入Token为2美元、输出Token为10美元,目前是最具性价比的模型之一。
在具体工作中,Argon也更倾向于处理复杂且长期的深度推理任务,比如软件工程、企业专业知识梳理以及网络安全防御等。
模型的
百万Token输出
上限,就是为这种长任务准备的,它能给模型更多连续工作的余地和充足的推理深度。
以谷歌内部使用情况为例,其中Argon在谷歌各数据中心自主识别并落地内存优化方案,待方案全面部署后,预计可释放超300 TiB内存。
另一个案例中,Argon Agent围绕视频解码器的Rust移植版本,反复实验并替换了3.2万行SIMD代码,最终版本运行速度达到原Rust移植版的2.7倍。
官方还重点强调了Argon的
防御性网络安全
优势。
它能够自主发现、验证并修补20多种语言的关键软件漏洞,在Wiz内部黑箱渗透测试中,模型可以在无源代码下实时分析网络系统,高效发现攻击面、识别漏洞以及生成概念验证证据。
为了防止滥用,Argon首批进入的是谷歌的Fairwind计划,面向经过审核的网络安全防御方。
对受信任的防御团队,谷歌会放开针对网络安全任务的部分限制,Argon将帮助防守方补洞,以及用来寻找攻击入口。
One More Thing
不过嘴上说说得了,Argon实际跑起来怎么样,还得打个问号。
毕竟咱普罗大众还没用上啊喂。。。
有小道消息透露,谷歌内部员工对Gemini 4
并不完全看好
。
一些接触过Gemini 4的员工认为,模型在实际编程任务中并没有跑分那么亮眼,网页和应用的前端界面设计仍是短板,甚至存在过度刷榜的嫌疑。
然而另一名熟悉开发工作的员工则表示,内部普遍认为Gemini 4已达到前沿水平。谷歌也回应称,说它编程表现不佳并不准确。
总之模型到底咋样,还有待观察。
所幸的是,
谷歌终于回到了牌桌之上
。
参考链接:
[1]
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/
[2]
https://www.bloomberg.com/news/articles/2026-09-30/google-grapples-with-employee-skepticism-about-new-gemini-model
[3]
https://x.com/MrZiruiWang/status/2105388591644131582
[4]
https://x.com/arena/status/2105394855644139908
[5]
https://x.com/ArtificialAnlys/status/2105392625788637299
版权所有,未经授权不得以任何形式转载及使用,违者必究。
Gemini
谷歌
鹭羽
何恺明团队新作:看猫片就能学会ARC挑战
2026-10-01
Qwen一号位定了!刘大一恒接棒
2026-09-23
通用能力不打折,空间具身智能断层领先!ZDTaichu5.0-9B国产开源,跻身全球多模态第一梯队
2026-09-16
今年外滩最特别Agent:能干活,能陪聊,还会朋友圈拉黑你
2026-09-13
扫码分享至朋友圈
相关阅读
谷歌裁员细节曝光:开源主管被裁,61岁程序员在线求职,有人60天内找不到工作将被遣返
员工太贵,公司扛不住
白交
2023-01-29
裁员
谷歌
谷歌IMO金牌模型可以用了!推理性能秒了o3、Grok 4
每月只要1800元
十三
2025-08-02
DeepMind
Gemini
Gemini 2.5 Deep Think
陶哲轩DeepMind梦幻联动,最强通用科学Agent来了!一口气解决芯片设计、矩阵乘法和300年几何难题
Nature:令人惊叹
白交
2025-05-15
Nature
谷歌
谷歌最强具身大脑发布!波士顿机器狗瞬间人模人样
Gemini Robotics主打空间推理的第三代模型。
henry
2026-04-17
Gemini
具身智能
京东与谷歌电商项目曝光:给新平台Google Shopping提供商户
栗子
2019-08-07
京东
谷歌
马斯克感叹硅谷AI春招太疯狂!百万美元年薪随便开,小扎一线当猎头,谷歌创始人返场抢人
硅谷AI人才争夺进入白热化
鱼羊
2024-04-06
Meta
硅谷
谷歌
热门文章
PCIe显卡被低估了!内核补齐+通信重构,DeepSeek推理吞吐翻近7倍
2026-09-24
别人忙着卷Code,Kimi抽身反打浏览器插件:网页操作一秒变Skill
2026-09-25
出海Agent“小元AI”入驻腾讯WorkBuddy:找买家写开发信谈生意
2026-09-24
亮出“中国最强AI芯片”还不够,平头哥又甩出一手开源
2026-09-25
GPT-6之后,具身智能走向何方?诺因发布GLOW技术报告,给出机器人“一教就会”的答案
2026-09-24
关于量子位
加入我们
寻求报道
商务合作
扫码关注量子位
追踪人工智能新趋势,报道科技行业新突破
量子位 QbitAI 版权所有©北京极客伙伴科技有限公司
京ICP备17005886号-1
本文来源:量子位