Gemini 3 Pro
Google 2025 年 11 月发布的旗舰多模态模型,1M 上下文 + LMArena 登顶 + vibe coding 标杆,同步推出 agent 开发平台 Antigravity。
发布 2026-06-28更新 2026-06-28规格
- 厂商
- 发布日期
- 2025/11/18
- 类型
- multimodal
- 上下文窗口
- 1000K tokens
- 最大输出
- 66K tokens
- 定价
- Input $2/M · Output $12/M(≤200K 上下文)
- API 兼容
- gemini, vertex-ai, openai
基准测试
优势
- •1M token 上下文,原生多模态(文本/图片/音频/视频/代码)
- •推理能力业界顶级,LMArena 1501 Elo 登顶
- •Vibe Coding 零样本生成交互式 Web UI 能力极强
- •长程 agent 规划稳,Vending-Bench 2 模拟经营一整年不跑偏
- •减少谄媚(sycophancy),事实准确率提升
不足
- •国内无官方 API,需走中转或 Vertex AI
- •纯编程 SWE-bench 76.2% 略低于 Claude Opus 4.5
- •Deep Think 深度推理模式仅对 AI Ultra 订阅开放
- •上下文超 200K 后 API 价格上浮
适用场景
概述
Gemini 3 Pro 是 Google 于 2025 年 11 月 18 日发布的最强模型,相比 Gemini 2.5 Pro 在推理、多模态和 agentic 能力上全面跃升。发布即在 LMArena 以 1501 Elo 登顶,被 Google 定位为「思维伙伴」——能用更少的提示理解深层意图。同步推出的 agent 开发平台 Google Antigravity 让 Gemini 3 Pro 直接驱动编辑器、终端和浏览器。
核心能力
顶级推理
GPQA Diamond(博士级科学推理)拿到 91.9%,远超 GPT-5 一代。Humanity's Last Exam 37.5%(无工具)。配套的 Deep Think 模式进一步把 GPQA 推到 93.8%、ARC-AGI-2 推到 45.1%,但仅对 Google AI Ultra 订阅者开放。
1M 多模态上下文
1M token 上下文 + 原生多模态,可同时理解文本、图片、音频、视频和代码。典型用法:
- 把整段教学视频喂进去做专家级分析(Video-MMMU 87.6%)
- 手写食谱照片转结构化菜谱
- 学术论文一键生成交互式记忆卡片
Vibe Coding
零样本生成富交互 Web UI 是 Gemini 3 Pro 的招牌能力,WebDev Arena 拿到 1487 Elo。配合 Gemini CLI 或 Antigravity,从一句话需求到可运行前端的链路极短。关于 vibe coding 的方法论见 Vibe Coding。
长程 Agent
在 Vending-Bench 2(模拟经营一家自动售货机生意一整年)上登顶,证明它能维持长周期目标不漂移。Terminal-Bench 2.0 拿到 54.2%,终端操作能力强。
API 调用示例
from google import genai
client = genai.Client(api_key="...")
resp = client.models.generate_content(
model="gemini-3-pro",
contents="分析这段代码的性能瓶颈并给出优化方案",
config={"thinking_config": {"thinking_level": "high"}},
)
print(resp.text)
也兼容 OpenAI 格式端点,方便从 GPT-5 平滑迁移。
定价
| 项目 | 价格(≤200K 上下文) |
|---|---|
| Input | $2 / 百万 token |
| Output | $12 / 百万 token |
超过 200K 上下文的请求价格上浮,长文档场景要算账。对比 Gemini 2.5 Pro 的 $1.25/$10,3 Pro 贵一档但能力提升明显。
与同档模型怎么选
| 维度 | Gemini 3 Pro | Claude Opus 4.5 | GPT-5 |
|---|---|---|---|
| 纯编程(SWE-bench) | 76.2% | SOTA(更高) | 68.0% |
| 多模态 | 原生(图+音+视频) | 仅图片 | 图+音+视频 |
| 上下文 | 1M | 200K | 400K |
| 推理(GPQA) | 91.9% | 强 | 62.5% |
| 国内可用 |
建议:要多模态 + 超长上下文 + vibe coding 选 Gemini 3 Pro;要最强纯编程 agent 选 Claude Opus 4.5。
避坑清单
- 国内无直连:需 Vertex AI 或中转,注意合规。
- 200K 是价格分界:超过后 input/output 双双上浮,长上下文任务先估成本。
- Deep Think 要 Ultra:普通 API 拿不到最强推理档,别按 Deep Think 的 benchmark 预期普通调用。
- thinking_level 别默认拉满:high 档贵且慢,日常任务用默认即可。
实际使用体验
1M 上下文实测
把一个中型项目(源码约 60 万 token)整包塞进去做架构分析,Gemini 3 Pro 能准确指出循环依赖、定位跨模块的副作用传播链路,召回率明显高于把代码分块喂给 Claude Opus 4.5。但要注意:单次请求响应会拉到 60-90 秒,且超过 200K 后单价上浮,整仓分析一次成本在 $1-3 量级。工程上更推荐用 Context Engineering 的分层加载策略,而不是无脑全塞。
Vibe Coding 实测
用「做一个带拖拽排序的看板,深色主题,数据存 localStorage」一句话需求,零样本生成的代码直接能跑,拖拽动画、列间移动、持久化都在位,UI 质量明显高于 GPT-5 同样的提示。复杂交互(如富文本编辑器 + 协同光标)仍需 2-3 轮迭代,但首版可用率很高。配合 Gemini CLI 做增量修改比单次生成更稳。方法论见 Vibe Coding。
多模态实测
- 视频理解:把一段 15 分钟的技术演讲喂进去,能准确总结章节、定位某个观点的时间戳,甚至识别白板上的公式。Video-MMMU 87.6% 的分数在真实场景中站得住。
- 截图分析:扔一张报错截图 + 一张设计稿,能准确读出报错堆栈并定位到设计稿中对应的组件区域,细粒度高于仅支持图片的 Claude Opus 4.5。
thinking_level 实测
low:响应 3-5 秒,简单问答和格式转换够用,复杂推理会翻车。medium(默认):多数任务的甜点档,速度和质量平衡好。high:响应 20-40 秒,thinking token 计入 output 费用,成本明显上升。GPQA 级别的难题和架构决策值得开,日常别拉满,按避坑清单说的来。
FAQ
Q: 1M 上下文真的能用满吗?
能,但有条件。纯文本(代码 + 文档)塞满 1M 没问题,响应会变慢但不会报错。混入大量图片/视频后实际可用 token 会缩水(一张高清图约 250-400 token,一段 10 分钟视频约 25 万 token)。工程上建议控制在 600K 以内留余量。
Q: Deep Think 和普通模式差多少?
GPQA 从 91.9% → 93.8%,ARC-AGI-2 拿到 45.1%,提升主要体现在最难的推理基准上。日常编程、写作、分析任务差距感知不强,只有顶级竞赛题和前沿科研才值得开。且 Deep Think 仅对 AI Ultra 订阅开放,API 调用拿不到。
Q: 国内怎么调用 Gemini 3 Pro?
三条路:① Google Cloud Vertex AI(需海外信用卡 + 海外区域,合规自查);② 第三方中转 API(如 OpenRouter,加价 20-50%);③ Antigravity 平台(需订阅 AI Ultra)。
Q: Gemini 3 Pro 和 Gemini 2.5 Pro 值得升级吗?
看场景。多模态、vibe coding、长上下文场景值得升——3 Pro 的 WebDev Arena 1487 领先一档,1M 上下文也更稳。纯文本对话、简单代码补全这种轻量场景,Gemini 2.5 Pro 性价比更高($1.25/$10 vs $2/$12)。
延伸阅读
- 对比同档:Claude Opus 4.5 / GPT-5 / Gemini 2.5 Pro
- 长上下文:Context Engineering
- 配套工具:Gemini CLI
Augment Code vs Cursor:企业 AI 编程怎么选?Context Engine vs AI IDE 对比
Augment Code vs Cursor 2026 选型对比:Context Engine 全仓索引的企业 AI 平台 vs SpaceX 收购的 AI IDE 天花板,从形态、Context 覆盖、长任务、价格、合规、中文支持和适合人群 8 个维度判断,帮你选对企业 AI 编程工具。
Cursor vs Aider:GUI IDE 还是 CLI?2026 对比
Cursor vs Aider 2026 选型对比:GUI IDE vs Git 原生 CLI,从 Composer vs Architect 双模型、Tab 补全、多模型 BYOK、价格计费、开源与否和适合人群判断,帮开发者选对。Cursor 是闭源 VS Code fork 月费 $20,Aider 是开源 Apache-2.0 CLI 自带 API key。
Cursor vs Claude Code:什么时候用哪个?(2026 实测选型)
Cursor 和 Claude Code 到底怎么选?一句话结论 + 决策树 + 价格实测 + 国内可用性对比。GUI 派选 Cursor,终端长任务派选 Claude Code,最优解其实是共存。
Cursor vs GitHub Copilot:AI IDE 还是插件?2026 对比
Cursor vs GitHub Copilot 2026 选型对比:AI 原生 IDE vs IDE 插件,从 Composer vs Agent Mode、Tab 补全、多模型、AI Credits 计费、企业版和适合人群判断,帮开发者选对。Cursor 是 VS Code fork 重写交互层,Copilot 是 VS Code 插件继承原生体验。两家都已切 usage 制。
Cursor vs Trae:国内开发者怎么选?价格、模型、网络和真实体验对比
Cursor vs Trae 2026 选型对比:从价格、模型能力、国内访问、Builder/Composer、多文件改写、MCP 生态和适合人群判断,帮国内开发者决定继续用 Cursor,还是切到字节 Trae。
Cursor vs v0:AI 编程 IDE vs AI 前端生成器怎么选?
Cursor vs v0 2026 选型对比:Anysphere 的 AI 原生 IDE vs Vercel 的 AI 前端组件生成器。从定位、工作流、输出物、价格、适合人群 6 个维度帮你选对工具:全栈工程选 Cursor,快速 UI 原型选 v0。