Gemini 3 Pro
Google 2025 年 11 月发布的旗舰多模态模型,1M 上下文 + LMArena 登顶 + vibe coding 标杆,同步推出 agent 开发平台 Antigravity。
规格
- 厂商
- 发布日期
- 2025/11/18
- 类型
- multimodal
- 上下文窗口
- 1000K tokens
- 最大输出
- 66K tokens
- 定价
- Input $2/M · Output $12/M(≤200K 上下文)
- API 兼容
- gemini, vertex-ai, openai
基准测试
✓ 优势
- •1M token 上下文,原生多模态(文本/图片/音频/视频/代码)
- •推理能力业界顶级,LMArena 1501 Elo 登顶
- •Vibe Coding 零样本生成交互式 Web UI 能力极强
- •长程 agent 规划稳,Vending-Bench 2 模拟经营一整年不跑偏
- •减少谄媚(sycophancy),事实准确率提升
⚠ 不足
- •国内无官方 API,需走中转或 Vertex AI
- •纯编程 SWE-bench 76.2% 略低于 Claude Opus 4.5
- •Deep Think 深度推理模式仅对 AI Ultra 订阅开放
- •上下文超 200K 后 API 价格上浮
适用场景
概述
Gemini 3 Pro 是 Google 于 2025 年 11 月 18 日发布的最强模型,相比 Gemini 2.5 Pro 在推理、多模态和 agentic 能力上全面跃升。发布即在 LMArena 以 1501 Elo 登顶,被 Google 定位为「思维伙伴」——能用更少的提示理解深层意图。同步推出的 agent 开发平台 Google Antigravity 让 Gemini 3 Pro 直接驱动编辑器、终端和浏览器。
核心能力
顶级推理
GPQA Diamond(博士级科学推理)拿到 91.9%,远超 GPT-5 一代。Humanity's Last Exam 37.5%(无工具)。配套的 Deep Think 模式进一步把 GPQA 推到 93.8%、ARC-AGI-2 推到 45.1%,但仅对 Google AI Ultra 订阅者开放。
1M 多模态上下文
1M token 上下文 + 原生多模态,可同时理解文本、图片、音频、视频和代码。典型用法:
- 把整段教学视频喂进去做专家级分析(Video-MMMU 87.6%)
- 手写食谱照片转结构化菜谱
- 学术论文一键生成交互式记忆卡片
Vibe Coding
零样本生成富交互 Web UI 是 Gemini 3 Pro 的招牌能力,WebDev Arena 拿到 1487 Elo。配合 Gemini CLI 或 Antigravity,从一句话需求到可运行前端的链路极短。关于 vibe coding 的方法论见 Vibe Coding。
长程 Agent
在 Vending-Bench 2(模拟经营一家自动售货机生意一整年)上登顶,证明它能维持长周期目标不漂移。Terminal-Bench 2.0 拿到 54.2%,终端操作能力强。
API 调用示例
from google import genai
client = genai.Client(api_key="...")
resp = client.models.generate_content(
model="gemini-3-pro",
contents="分析这段代码的性能瓶颈并给出优化方案",
config={"thinking_config": {"thinking_level": "high"}},
)
print(resp.text)
也兼容 OpenAI 格式端点,方便从 GPT-5 平滑迁移。
定价
| 项目 | 价格(≤200K 上下文) |
|---|---|
| Input | $2 / 百万 token |
| Output | $12 / 百万 token |
超过 200K 上下文的请求价格上浮,长文档场景要算账。对比 Gemini 2.5 Pro 的 $1.25/$10,3 Pro 贵一档但能力提升明显。
与同档模型怎么选
| 维度 | Gemini 3 Pro | Claude Opus 4.5 | GPT-5 |
|---|---|---|---|
| 纯编程(SWE-bench) | 76.2% | SOTA(更高) | 68.0% |
| 多模态 | 原生(图+音+视频) | 仅图片 | 图+音+视频 |
| 上下文 | 1M | 200K | 400K |
| 推理(GPQA) | 91.9% | 强 | 62.5% |
| 国内可用 | ❌ | ❌ | ❌ |
建议:要多模态 + 超长上下文 + vibe coding 选 Gemini 3 Pro;要最强纯编程 agent 选 Claude Opus 4.5。
避坑清单
- 国内无直连:需 Vertex AI 或中转,注意合规。
- 200K 是价格分界:超过后 input/output 双双上浮,长上下文任务先估成本。
- Deep Think 要 Ultra:普通 API 拿不到最强推理档,别按 Deep Think 的 benchmark 预期普通调用。
- thinking_level 别默认拉满:high 档贵且慢,日常任务用默认即可。
实际使用体验
1M 上下文实测
把一个中型项目(源码约 60 万 token)整包塞进去做架构分析,Gemini 3 Pro 能准确指出循环依赖、定位跨模块的副作用传播链路,召回率明显高于把代码分块喂给 Claude Opus 4.5。但要注意:单次请求响应会拉到 60-90 秒,且超过 200K 后单价上浮,整仓分析一次成本在 $1-3 量级。工程上更推荐用 Context Engineering 的分层加载策略,而不是无脑全塞。
Vibe Coding 实测
用「做一个带拖拽排序的看板,深色主题,数据存 localStorage」一句话需求,零样本生成的代码直接能跑,拖拽动画、列间移动、持久化都在位,UI 质量明显高于 GPT-5 同样的提示。复杂交互(如富文本编辑器 + 协同光标)仍需 2-3 轮迭代,但首版可用率很高。配合 Gemini CLI 做增量修改比单次生成更稳。方法论见 Vibe Coding。
多模态实测
- 视频理解:把一段 15 分钟的技术演讲喂进去,能准确总结章节、定位某个观点的时间戳,甚至识别白板上的公式。Video-MMMU 87.6% 的分数在真实场景中站得住。
- 截图分析:扔一张报错截图 + 一张设计稿,能准确读出报错堆栈并定位到设计稿中对应的组件区域,细粒度高于仅支持图片的 Claude Opus 4.5。
thinking_level 实测
low:响应 3-5 秒,简单问答和格式转换够用,复杂推理会翻车。medium(默认):多数任务的甜点档,速度和质量平衡好。high:响应 20-40 秒,thinking token 计入 output 费用,成本明显上升。GPQA 级别的难题和架构决策值得开,日常别拉满,按避坑清单说的来。
FAQ
Q: 1M 上下文真的能用满吗?
能,但有条件。纯文本(代码 + 文档)塞满 1M 没问题,响应会变慢但不会报错。混入大量图片/视频后实际可用 token 会缩水(一张高清图约 250-400 token,一段 10 分钟视频约 25 万 token)。工程上建议控制在 600K 以内留余量。
Q: Deep Think 和普通模式差多少?
GPQA 从 91.9% → 93.8%,ARC-AGI-2 拿到 45.1%,提升主要体现在最难的推理基准上。日常编程、写作、分析任务差距感知不强,只有顶级竞赛题和前沿科研才值得开。且 Deep Think 仅对 AI Ultra 订阅开放,API 调用拿不到。
Q: 国内怎么调用 Gemini 3 Pro?
三条路:① Google Cloud Vertex AI(需海外信用卡 + 海外区域,合规自查);② 第三方中转 API(如 OpenRouter,加价 20-50%);③ Antigravity 平台(需订阅 AI Ultra)。
Q: Gemini 3 Pro 和 Gemini 2.5 Pro 值得升级吗?
看场景。多模态、vibe coding、长上下文场景值得升——3 Pro 的 WebDev Arena 1487 领先一档,1M 上下文也更稳。纯文本对话、简单代码补全这种轻量场景,Gemini 2.5 Pro 性价比更高($1.25/$10 vs $2/$12)。
延伸阅读
- 对比同档:Claude Opus 4.5 / GPT-5 / Gemini 2.5 Pro
- 长上下文:Context Engineering
- 配套工具:Gemini CLI