谷歌Gemini 4 Pro首测登顶Arena 多项基准全面SOTA

商业品牌
2026 09-20 20:58:12
分享

  【CNMO科技消息】近日,一个以"gemini-3.8-flash"为马甲的神秘模型现身大模型竞技场Arena,在多轮盲测中被广泛认为是谷歌尚未发布的Gemini 4 Pro,其性能表现引发AI圈的高度关注。

Gemini
Gemini

  最受关注的一次演示是"机械蝴蝶"任务:一位开发者要求模型使用Three.js从零编写并渲染出结构复杂的机械蝴蝶,这类实时代码生成考验空间几何理解、光影材质着色器调度与多轴物理模拟能力,稍有差错便会导致浏览器崩溃。结果显示,相比Fable 5.1 Max,处于暗中测试状态的Gemini 4 Pro耗时减少约67%。

  此外,还有开发者制作的同款机械蝴蝶加入了爆炸视图、飞行模式与组件标注等交互。在3D手表、机器人"瓦力"等横向对比中,Gemini 4 Pro在爆炸视图与构件设计上表现突出,并会在未被要求的情况下自主添加动画与交互细节。

  真正引发震动的是流出的基准测试数据。在这份对比中,Gemini 4 Pro在多项测试里取得全面SOTA:DeepSWE v1.1智能体编码任务拿下88.7%,超过GPT-6 Astra的86.9%;GDPval-AA v2真实知识工作任务成为唯一突破2000 Elo大关的模型,达到2064;Terminal-bench 2.1终端编码能力为95.3%,全场最高;OSWorld-2.0计算机操作测试为86.8%,同样排名第一。

  在考察Agent连续多步执行能力的Terminal-Bench 4.0中,它与自家Flash的差距从上代的3.2%拉大到13.9%,显示任务越复杂、步骤越多,其优势越明显。价格方面,该模型每百万Token输入2.25美元、输出11.25美元,在顶级旗舰中颇具竞争力。

来源:手机中国
The End
免责声明:本文内容来源于第三方或整理自互联网,本站仅提供展示,不拥有所有权,不代表本站观点立场,也不构成任何其他建议,对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性不作任何保证或承诺,请读者仅作参考,并请自行核实相关内容,不承担相关法律责任。如发现本站文章、图片等内容有涉及版权/违法违规或其他不适合的内容, 请及时联系我们进行处理。