一 概览与定位

  • 发布时间2025-11-18,定位为谷歌迄今最强的多模态旗舰,主打复杂推理、高级编程、长上下文与 Agentic 工作流

  • 核心卖点:原生多模态(文本/图片/音频/视频/代码)、超长上下文、更强的“深度思考”模式、面向任务的智能体能力。

  • 开放状态:已面向大众开放体验,可在Gemini 应用Google AI Studio直接使用;美国地区订阅 AI Pro/Ultra​ 的用户可在搜索的 AI 模式启用“Thinking”选项调用该模型。

  • 一句话判断:在推理、多模态与前端“Vibe Coding”上显著增强,长上下文与智能体场景具备明显优势,是面向“学、建、规划”的一体化升级。

二 关键评测数据与表现

  • 综合榜单与通用推理

    • LMArena Elo:1501(登顶),显示综合对话与指令跟随能力的领先。

    • Humanity’s Last Exam(无工具)37.5%;(配合搜索与代码执行):45.8%,博士级推理显著强化。

    • GPQA Diamond91.9%,科学问答与严谨推理达到旗舰水准。

  • 数学与编程

    • AIME 2025:无工具 95.0%;配合代码执行 100%,数学竞赛级难题表现突出。

    • LiveCodeBench Pro Elo2,439,竞技编程类任务竞争力强。

    • Terminal-Bench 2.054.2%,终端/命令行类智能体任务稳健。

  • 多模态与视频理解

    • MMMU-Pro81.0%Video-MMMU87.6%ScreenSpot-Pro72.7%,在视频、屏幕与跨模态理解上优势明显。

  • 长上下文与检索

    • MRCR v2(8-needle)77.0%(1M 上下文点式检索);SimpleQA Verified72.1%,长文档与事实性问答稳定。

  • 智能体与长时规划

    • t2-bench85.4%(工具使用);Vending-Bench 2:净收益均值 $5,478.16,长周期决策与执行能力领先。

  • 深度思考模式(Deep Think)

    • Humanity’s Last Exam41.0%GPQA Diamond93.8%ARC-AGI-245.1%,在极限推理与抽象模式识别上进一步拉升上限。

三 真实场景体验与样例

  • 前端与“Vibe Coding”

    • 单文件 HTML/CSS/JS 高保真 UI:复刻Windows XP 桌面(含图标、开始菜单、任务栏时钟、开机音效、记事本与模拟浏览器),交互细节完整。

    • 风格化 UI 还原:赛博朋克交易界面、新艺术风格画廊、蒸汽朋克工作室等,零素材依赖、复杂 CSS 动效与有机形态还原度高。

    • 复杂交互原型:浏览器端Game Boy 模拟器(含《魂斗罗》《俄罗斯方块》)、可交互水波物理模拟,代码组织清晰、注释详尽。

  • 学习与办公自动化

    • 多模态“第二大脑”:可同时消化截图、预算表、行程偏好等,产出杂志化动态视图与可交互计划。

    • 家庭辅导:拍照上传几何题,可按8岁理解层级分步讲解。

    • 会议/长文档:对1小时录音数百页 PDF进行要点提炼、风险点定位与表格化输出,显著提效。

四 可用性与生态

  • 体验入口与开放节奏

    • Gemini 应用:模型选择器中选择 Thinking​ 即可调用;美国地区 AI Pro/Ultra​ 订阅用户可在搜索 AI 模式体验。

    • Google AI Studio:提供免费层(有速率/配额限制),便于原型与小规模测试。

    • API 与开发:可通过 Gemini API / Vertex AI​ 接入;面向智能体的 Google Antigravity​ 提供原生 IDE 协同(当前对部分地区 IP/账号不开放)。

    • 第三方生态:已集成至 Cursor、JetBrains、GitHub Copilot、Replit​ 等工具链,支持“规划→编码→运行→验证”的端到端开发体验。

五 优势、局限与选型建议

  • 优势

    • 推理与多模态双强:数学/科学推理、视频/屏幕理解处于第一梯队。

    • 长上下文稳:百万级 token 上下文与高难度检索任务表现可靠。

    • 智能体工作流:工具使用、终端操作与长时规划收益显著,适合复杂任务自动化。

    • 前端生成与交互原型:单文件可运行的高质量 UI/小游戏/可视化案例丰富。

  • 局限

    • 生态与地域可用性:部分能力(如搜索 AI 模式、Antigravity)对地区/账号有限制;企业落地需评估合规与数据驻留。

    • 工程化深度:在复杂状态管理、可维护性与安全工程上仍需人工把关(通用模型通病)。

    • 个别视觉任务不稳:如“六指手部”等极端视觉样例存在失误。

  • 选型建议

    • 适合:需要复杂推理多模态理解长文档/视频处理前端原型到可运行 Demo多步自动化的个人/团队与企业。

    • 搭配:数据敏感/合规要求高选 Vertex AI;快速试验与教学选 AI Studio;编程协作选 Cursor/JetBrains/GitHub Copilot​ 集成。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐