TranslateGemma
Google Translate 团队基于 Gemma 3 训练的开源专用翻译模型家族,2026-01-15 发布,提供 4B / 12B / 27B 三个尺寸,WMT24++ 评测覆盖 55 种语言,支持文本与「图片中的文字」两种输入,可在端侧完全离线运行。12B 版本在 WMT24++ 的 MetricX 上超过了参数量两倍于它的 Gemma 3 27B 基线。输入上下文约 2000 token,权重按 Gemma 条款开放。
发布 2026-09-18更新 2026-09-18核实 2026-09-18规格
- 厂商
- 谷歌
- 发布日期
- 2026/1/15
- 类型
- multimodal
- 上下文窗口
- 2K tokens
- 定价
- Gemma 条款下免费下载权重(Hugging Face / Kaggle)· 自部署算力自负 · 亦可通过 Vertex AI Model Garden 部署(按云资源计费)
- API 兼容
- Hugging Face Transformers, Kaggle, Vertex AI Model Garden
基准测试
优势
- •完全离线:权重可下载到本地、NAS 或私有 GPU 节点运行,翻译过程不需要联网,适合数据不出域的合同、病历、政务与技术文档场景
- •专用训练效率高:12B 在 WMT24++ 的 MetricX 上取得 3.60,优于参数量两倍的 Gemma 3 27B 基线(5.32 为 4B、3.09 为 27B;MetricX 越低越好)
- •三档尺寸对应三种硬件:4B 面向移动与边缘设备,12B 面向消费级笔记本,27B 面向 GPU / 云端
- •支持图片输入翻译:继承 Gemma 3 的视觉能力,可识别招牌、菜单、截图中的文字并翻译
- •两阶段训练:先用人工翻译数据与 Gemini 生成的平行语料做监督微调,再用 MetricX-QE、AutoMQM 等翻译奖励模型做强化学习
- •官方 chat template 支持地区变体语言代码(如 en-GB),便于处理同一种语言的区域差异
- •WMT24++ 的 COMET 分数为 4B 81.6 / 12B 83.5 / 27B 84.4,三档梯度清晰,便于按预算选型
不足
- •输入上下文仅约 2000 token,长文档必须自建切块与合并逻辑,直接丢整篇会静默截断
- •55 种是「评测覆盖」口径;官方说明另训练了近 500 个语言对,但**这些语言对在发布时没有确认的评测指标**
- •权重按 Gemma 条款发布,含再分发要求与禁用政策,商用前需法务确认——开源权重不等于无限制商用
- •翻译专用模型,不是通用聊天模型,也不具备 Agent 能力;不能替代通用 LLM 的推理与工具调用
- •基准平均值不能证明任何特定语言对、领域、方言或文档类型的质量,生产环境仍需自建双语评测与人工复核
适用场景
定位一句话
TranslateGemma 是 Google Translate 团队基于 Gemma 3 训练的开源专用翻译模型家族,2026-01-15 发布,提供 4B / 12B / 27B 三个尺寸,WMT24++ 评测覆盖 55 种语言,支持文本与图片中的文字两类输入,可在端侧完全离线运行。
它的价值主张不是「一个会翻译的聊天模型」,而是把翻译能力从云端接口下沉成一个可以装在自己机器上的专用层——这对「数据不出域」的翻译场景(合同、病历、政务、技术资料)是结构性变化。
2026-09 上下文:该模型在 2026-09-15 前后谷歌发布的多语言 AI 战略中被重新推到台前,作为面向「超过 30 亿无稳定互联网连接人群」的离线方案。详见 谷歌 300 语种与 TranslateGemma。
三档尺寸怎么选
| 尺寸 | 定位 | MetricX(WMT24++,越低越好) | COMET |
|---|---|---|---|
| 4B | 移动设备 / 边缘设备 / 本地技术验证 | 5.32 | 81.6 |
| 12B | 消费级笔记本 / 工作站 | 3.60 | 83.5 |
| 27B | GPU 服务器 / 云端,追求最高质量 | 3.09 | 84.4 |
选型规则:先看硬件能跑哪一档,再看你的错误预算。值得注意的是 12B 的 MetricX(3.60)优于参数量两倍的 Gemma 3 27B 基线——在翻译这个边界清晰的任务上,专用训练的效率优势大于参数规模优势。
获取方式与成本
| 通道 | 成本 | 适合 |
|---|---|---|
| Hugging Face / Kaggle 下载权重 | 免费(Gemma 条款) | 本地、NAS、私有 GPU 节点,数据不出域 |
| 自建推理服务(Transformers / vLLM 等) | 硬件 + 电力 | 需要高并发或常驻服务 |
| Vertex AI Model Garden | 按云资源计费 | 不想自建运维,且数据可上云 |
两点必须在采购前确认:一是 Gemma 条款含再分发要求与禁用政策,商用前请法务过一遍;二是免费的是权重,不是算力——27B 档的自部署硬件成本并不低。
API 调用示例(本地 Transformers)
from transformers import AutoProcessor, AutoModelForImageTextToText
import torch
model_id = "google/translategemma-4b-it"
processor = AutoProcessor.from_pretrained(model_id)
model = AutoModelForImageTextToText.from_pretrained(
model_id, torch_dtype=torch.bfloat16, device_map="auto"
)
messages = [
{
"role": "user",
"content": [
{"type": "text", "source_lang_code": "en", "target_lang_code": "zh-Hans",
"text": "The warranty does not cover damage caused by unauthorized repair."},
],
}
]
inputs = processor.apply_chat_template(
messages, tokenize=True, add_generation_prompt=True,
return_dict=True, return_tensors="pt",
).to(model.device)
out = model.generate(**inputs, max_new_tokens=256)
print(processor.decode(out[0], skip_special_tokens=True))
官方 chat template 要求一次只传一个文本或图片条目,并显式给出 source / target 语言代码;支持地区变体写法(如
en-GB、zh-Hans)。
生产落地的检查清单
- 先建双语测试集,覆盖术语、人名、数字、格式、歧义、方言与对抗性输入——基准平均分不能代表你的语言对。
- 长文档必须切块。 约 2000 token 的输入上限是硬边界,需要自建切块 + 术语表 / 翻译记忆层。
- 加兜底与路由。 低置信度结果转人工,法律、医疗、金融、移民等高后果内容必须人工复核。
- 做可观测性。 记录每条请求的源语言、目标语言、模型尺寸与耗时,便于定位回归。
- 合规前置。 确认 Gemma 条款对你们的使用形式(含再分发)是否允许。
适合 / 不适合
适合
- 有「数据不出域」硬要求的翻译场景(合同、病历、政务、内部技术资料)
- 需要在无网络或弱网环境工作的边缘设备与现场作业
- 想把通用 LLM 的翻译请求分流给更便宜、更可控的专用模型
- 翻译研究与语言对基准评测
- 截图、招牌、扫描件中的文字提取与翻译
不适合
- 需要翻译超长文档且不愿自建切块管线的场景(输入上限约 2000 token)
- 需要通用推理、工具调用或多轮 Agent 能力的场景
- 依赖官方确认指标的近 500 个额外语言对(发布时无评测数据)
- 无法接受 Gemma 条款再分发要求的商用分发
相关阅读
- 资讯:谷歌 300 语种里程碑与 TranslateGemma · AI 编程周报 2026-09-18
- 本地部署:Ollama · LM Studio · Jan · vLLM · GPT4All
- 同期对手:GLM-5.3 · DeepSeek V4.1-Flash · Qwen3-Coder
- 概念:BYOK · 上下文工程
来源
- AI for everyone in every language — Google 官方博客(The Keyword)
- TranslateGemma: Models, Languages & Limitations — The Rundown AI
- TranslateGemma 2026 深度评测:55 语言翻译、图片文字抽取与低资源部署边界 — YOLO LAB
- TranslateGemma 怎样在本地处理企业文档与图片翻译 — 美步科技
- 开源模型与 AI 芯片密集突破 — 腾讯新闻·前沿在线
待核实:WMT24++ 的 MetricX 与 COMET 分数引自官方 model card 与第三方整理,「12B 超过 Gemma 3 27B 基线」为官方口径,未见独立复现;近 500 个额外语言对官方明确说明暂无确认评测指标。本卡由 AI 之家 编辑部基于公开资料整理,非厂商付费内容。
LM Studio vs Msty:本地大模型桌面工具怎么选?2026 对比
LM Studio vs Msty 2026 选型对比:模型浏览器 + OpenAI 兼容 API 的本地推理工具 vs 多模型并行 + Knowledge Stack 的桌面 AI 工作站。从定位、易用性、模型发现、API 服务、价格和适合人群 6 个维度帮你选对本地 LLM 桌面工具。
Msty vs Ollama:本地大模型怎么跑?2026 对比
Msty vs Ollama 2026 选型对比:精品桌面 GUI 工作站 vs 本地 LLM Daemon 事实标准。从定位、易用性、模型管理、功能、价格、适用人群 6 个维度帮你选对本地大模型方案。
Ollama vs LM Studio:本地跑大模型,命令行派 vs 图形派(2026 选型)
Ollama 和 LM Studio 都能在本机跑开源大模型。一句话结论 + 决策树 + 成本对比:要命令行、要被其他工具调用选 Ollama,要图形界面、要可视化调参选 LM Studio。
vLLM vs Ollama:本地推理引擎与本地模型运行时怎么选(2026)
vLLM 是高吞吐推理引擎,Ollama 是开箱即用的本地模型运行时。一句话结论 + 决策树 + 成本对比:要生产级吞吐与并发选 vLLM,要个人本地快速跑起来选 Ollama。