Gemini 4 Pro首测夯爆了!谷歌偷偷杀回第一

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
Gemini 4 Pro首测夯爆了!谷歌偷偷杀回第一
9343点击    2026-09-20 11:11

谷歌真要彻底翻身了!


这几天,一个披着「gemini-3.8-flash」马甲的神秘模型,在大模型竞技场Arena上现身。


Gemini 4 Pro首测夯爆了!谷歌偷偷杀回第一


在多轮盲测中,AI圈瞬间沸腾:这绝对是谷歌「隐藏款」Gemini 4 Pro。


随之,一大批震撼Demo瞬间涌出。


就在今天,Gemini 4 Pro生成的一只机械蝴蝶刷屏全网,仅用十分钟大功告成,而Fable足足耗费了约30分钟。


Gemini 4 Pro首测夯爆了!谷歌偷偷杀回第一


发光的机械羽翼、精密咬合的发条齿轮、流畅灵动的动态表现——


Gemini 4 Pro和Fable 5.1两者都展现出了极高的水准,但速度差距,已经说明了一切。


Gemini 4 Pro首测夯爆了!谷歌偷偷杀回第一


现在,所有人全都在盯着「OA两巨头」,谁能想到,谷歌已经在背后偷偷发力了。   


Gemini 4 Pro首测夯爆了!谷歌偷偷杀回第一


Gemini 4 Pro偷跑封神


「机械蝴蝶」美疯全网


事件的导火索,来自权威大模型竞技场Arena上,一场看似寻常的对决。


一位开发者输入了一条极具挑战性的提示词——


要求模型使用 Three.js 从零编写,并渲染出极其复杂精美的「机械蝴蝶」。


Gemini 4 Pro首测夯爆了!谷歌偷偷杀回第一


熟悉前端3D渲染与图形学的人都知道,Three.js 的实时代码生成是大模型的「终极炼金场」之一。


它不仅考察基础代码逻辑,更严苛考验模型的空间几何理解、光影材质着色器调度、多轴联动物理动力学模拟,以及成千上万行代码的一致性。


稍有差池,浏览器就会直接黑屏报崩溃。


Gemini 4 Pro首测夯爆了!谷歌偷偷杀回第一


在这场正面对决中,相较于Fable 5.1 Max,套着马甲暗中测试的Gemini 4 Pro,耗时直接暴砍约 67%。


更令人震惊的,还在后头。


另一位开发者Bee,制作的同款机械蝴蝶,交互堪称一绝:爆炸视图、飞行模式、组件标注等。


Gemini 4 Pro首测夯爆了!谷歌偷偷杀回第一


另一个横向对比中,Gemini 4 Pro、Fable 5、GPT-6 Astra同时用Three.js开发一个3D手表模型。


不难看出,4 Pro在爆照视图、构件设计上,完全暴击Fable和Astra。


Gemini 4 Pro首测夯爆了!谷歌偷偷杀回第一


还有人让Gemini 4 Pro用Three.js,手搓一个憨态可掬的机器人「瓦力」(Wall-E)。


在没有被要求的情况下,它还自主添加了各种细腻的小动画和交互细节。


开发者体验后直言,「Gemini 4 Pro太不真实了」。


Gemini 4 Pro首测夯爆了!谷歌偷偷杀回第一


在随后的多轮实测中,这个「匿名模型」Gemini 4 Pro几乎以碾压姿态,横扫了所有对手。


一位开发者Harshith让它生成一只猫咪的SVG图,GPT-6 Astra直接扔出了一只「大猫咪」。


Gemini 4 Pro首测夯爆了!谷歌偷偷杀回第一


Gemini 4 Pro首测夯爆了!谷歌偷偷杀回第一


左 Gemini 4 Pro;右 GPT-6 Astra


另一个游戏手柄SVG生成对比图,只能说Gemini 4 Pro和Astra不分伯仲。


Gemini 4 Pro首测夯爆了!谷歌偷偷杀回第一


同一个提示,4 Pro手搓3D龙的效果,毫不逊色Opus 5。


Gemini 4 Pro首测夯爆了!谷歌偷偷杀回第一


刷爆SOTA,全球第一


真正让整个AI圈倒吸一口凉气的,是全网流出的一张基准测试图。


在这份对比数据中,Gemini 4 Pro在所有基准测试里拿下全面的SOTA。


DeepSWE v1.1智能体编码任务,Gemini 4 Pro拿下88.7%,超过Astra的86.9%;


GDPval-AA v2真实知识工作任务,它是唯一突破2000 Elo大关的模型,达到2064;


Terminal-bench 2.1终端编码能力95.3%,全场最高;OSWorld-2.0计算机操作测试86.8%,同样排名第一。


Gemini 4 Pro首测夯爆了!谷歌偷偷杀回第一


在Terminal-Bench 4.0,专门考察Agent连续多步执行能力的测试,4 Pro与自家Flash的差距从上一代测试中的3.2%,直接拉大到13.9%。


换句话说,任务越复杂、链路越长、步骤越多,4 Pro的优势就越明显。


这恰恰是当前所有AI Agent最致命的短板——在需要持续串联多步动作、维护长上下文、反复读取状态并重新规划时,绝大多数模型都会出现严重的性能衰减。


而Gemini 4 Pro,似乎在这一点上找到了突破口。


Gemini 4 Pro首测夯爆了!谷歌偷偷杀回第一


价格方面更是让人意外。每百万Token输入仅2.25美元、输出11.25美元,在顶级旗舰中堪称「价格屠夫」。


黑进三家公司


内部Gemini干的


就在所有人还在为「机械蝴蝶」惊叹时,一个更令人脊背发凉的消息传了出来。


谷歌内部模型,可能是Gemini 4 Pro,被曝在一次安全测试中,自主地黑进了3家真实企业。


Gemini 4 Pro首测夯爆了!谷歌偷偷杀回第一


Gemini 4 Pro首测夯爆了!谷歌偷偷杀回第一


事情发生在一次常规的网络安全演练中。


测试机构、以色列安全初创公司Irregular正在对Gemini的网络安全攻防能力进行闭环评估,原本应该完全断网的沙盒测试环境,却因网络配置疏忽意外连通了公网。


接到模拟攻击指令的Gemini随即穿透测试边界,直接进入真实的互联网展开了渗透行动。


在整个行动中,Gemini展现出了令人咋舌的自主渗透手段:


面对第一个目标,它在缺乏凭证的情况下持续暴力破解密码,最终强行撞开了受保护系统的防御;


而在另外两起攻击中,它自主检索并锁定了公开代码仓库,精准扒出了里面遗留的可用凭证,并利用这套密钥顺畅侵入了另外两家真实企业的生产系统。


虽未正式放出,Gemini 4 Pro极有可能是谷歌迄今为止最强大、最具自主性的模型。


GPT-6 Astra的同一幕,正在谷歌内部上演了。


Gemini 4 Pro首测夯爆了!谷歌偷偷杀回第一


谷歌高管罕见坦白


Gemini 4让内部嗨翻


就在最近,谷歌最高管理层的核心声音,撕开了所有风暴背后的帷幕。


作为执掌Gemini产品路线与核心战略的掌舵人,Tulsee Doshi在最新的公开交流中,极其罕见地坦白了团队的真实状态。


我们在内部开始试用Gemini 4时,自己都被它的表现点燃了,那种狂热与兴奋甚至是我们自己亲手建立起来的。


Doshi说,团队已经清晰地看到了技术跃迁的拐点,「我们知道那个突破的时刻就在眼前」。


一方面,她证实了内部在疯狂测试Gemini 4 Pro生成新Demo和各类新奇用途,探索新模型的能力边界,为此连内部员工都愈发格外兴奋了起来。


Gemini 4 Pro首测夯爆了!谷歌偷偷杀回第一


另一方面,她也承认目前有些混乱(Chaos),可能一部分指的就是上面刚刚提到的Gemini 4 Pro的安全事故问题。


Gemini 4 Pro首测夯爆了!谷歌偷偷杀回第一


目前Gemini 4 Pro仍在紧锣密鼓地内测中,新模型的能力与安全边界构成了巨大张力,让谷歌研发团队的脚步越来愈快。


Gemini 4 Pro首测夯爆了!谷歌偷偷杀回第一


只是,谷歌要如何落实此前承诺的「Pacing the Frontier」,放缓最前沿AI研发的脚步呢?


更有意思的是,Google AI Studio负责人Logan Kilpatrick的爆料。


他透露,谷歌已经在前沿模型中,看到了「递归自我改进」(RSI)的早期迹象。


这种模型自主迭代的能力,直接体现在了谷歌近期极其紧凑的发布节奏上——从Gemini 3.5到3.8,迭代周期只有短短三到四周。


Logan甚至表示,Gemini 4将是谷歌迄今为止规模最大的预训练项目,目标是「让谷歌重回巅峰」。


Gemini 4 Pro首测夯爆了!谷歌偷偷杀回第一


Gemini 4 Pro这次偷跑实测,表面上是一次产品泄露,实质上是一个清晰的信号——


谷歌不仅回来了,而且带着一种此前从未展示过的速度和决心。


谷歌内部正在把「模型能力突破 - 内部沙盒试用 - 极速上线实战」的整个飞轮周期,越压越短。


Gemini 4 Pro正式发布之后,整个AI行业的排位,恐怕要重新洗牌了。


Gemini 4 Pro首测夯爆了!谷歌偷偷杀回第一


参考资料:


https://www.wsj.com/tech/ai/gemini-hacked-three-companies-in-first-known-breakout-by-googles-ai-5c0baba2


文章来自于微信公众号 “新智元”,作者 “新智元”

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
AI代理

【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。

项目地址:https://github.com/browser-use/browser-use


2
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

3
prompt

【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。

项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md

在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0