跳到主内容
multimodal谷歌

TranslateGemma

Google Translate 团队基于 Gemma 3 训练的开源专用翻译模型家族,2026-01-15 发布,提供 4B / 12B / 27B 三个尺寸,WMT24++ 评测覆盖 55 种语言,支持文本与「图片中的文字」两种输入,可在端侧完全离线运行。12B 版本在 WMT24++ 的 MetricX 上超过了参数量两倍于它的 Gemma 3 27B 基线。输入上下文约 2000 token,权重按 Gemma 条款开放。

发布 2026-09-18更新 2026-09-18核实 2026-09-18

规格

厂商
谷歌
发布日期
2026/1/15
类型
multimodal
上下文窗口
2K tokens
定价
Gemma 条款下免费下载权重(Hugging Face / Kaggle)· 自部署算力自负 · 亦可通过 Vertex AI Model Garden 部署(按云资源计费)
API 兼容
Hugging Face Transformers, Kaggle, Vertex AI Model Garden

基准测试

4B 5.32 / 12B 3.60 / 27B 3.09
WMT24++ MetricX(越低越好)
4B 81.6 / 12B 83.5 / 27B 84.4
WMT24++ COMET
55 种(WMT24++)
评测覆盖语言数
近 500 个(官方称暂无确认评测指标)
额外训练语言对
约 2000 token(图片归一化为 896×896、编码 256 token)
输入上下文

优势

  • 完全离线:权重可下载到本地、NAS 或私有 GPU 节点运行,翻译过程不需要联网,适合数据不出域的合同、病历、政务与技术文档场景
  • 专用训练效率高:12B 在 WMT24++ 的 MetricX 上取得 3.60,优于参数量两倍的 Gemma 3 27B 基线(5.32 为 4B、3.09 为 27B;MetricX 越低越好)
  • 三档尺寸对应三种硬件:4B 面向移动与边缘设备,12B 面向消费级笔记本,27B 面向 GPU / 云端
  • 支持图片输入翻译:继承 Gemma 3 的视觉能力,可识别招牌、菜单、截图中的文字并翻译
  • 两阶段训练:先用人工翻译数据与 Gemini 生成的平行语料做监督微调,再用 MetricX-QE、AutoMQM 等翻译奖励模型做强化学习
  • 官方 chat template 支持地区变体语言代码(如 en-GB),便于处理同一种语言的区域差异
  • WMT24++ 的 COMET 分数为 4B 81.6 / 12B 83.5 / 27B 84.4,三档梯度清晰,便于按预算选型

不足

  • 输入上下文仅约 2000 token,长文档必须自建切块与合并逻辑,直接丢整篇会静默截断
  • 55 种是「评测覆盖」口径;官方说明另训练了近 500 个语言对,但**这些语言对在发布时没有确认的评测指标**
  • 权重按 Gemma 条款发布,含再分发要求与禁用政策,商用前需法务确认——开源权重不等于无限制商用
  • 翻译专用模型,不是通用聊天模型,也不具备 Agent 能力;不能替代通用 LLM 的推理与工具调用
  • 基准平均值不能证明任何特定语言对、领域、方言或文档类型的质量,生产环境仍需自建双语评测与人工复核

适用场景

企业内网的离线文档翻译(合同、技术手册、产品资料),满足数据不出域要求边缘与工业现场设备的多语言界面与说明书翻译(4B 档)截图、招牌、扫描件中的文字提取与翻译(图片输入)翻译研究与语言对基准测试(三个尺寸 + 公开评测数据 + 技术报告)在自有语料上按特定语言对与术语集做微调或评测为现有翻译流水线增加「断网可用」的降级通道

定位一句话

TranslateGemma 是 Google Translate 团队基于 Gemma 3 训练的开源专用翻译模型家族2026-01-15 发布,提供 4B / 12B / 27B 三个尺寸,WMT24++ 评测覆盖 55 种语言,支持文本图片中的文字两类输入,可在端侧完全离线运行

它的价值主张不是「一个会翻译的聊天模型」,而是把翻译能力从云端接口下沉成一个可以装在自己机器上的专用层——这对「数据不出域」的翻译场景(合同、病历、政务、技术资料)是结构性变化。

2026-09 上下文:该模型在 2026-09-15 前后谷歌发布的多语言 AI 战略中被重新推到台前,作为面向「超过 30 亿无稳定互联网连接人群」的离线方案。详见 谷歌 300 语种与 TranslateGemma

三档尺寸怎么选

尺寸定位MetricX(WMT24++,越低越好)COMET
4B移动设备 / 边缘设备 / 本地技术验证5.3281.6
12B消费级笔记本 / 工作站3.6083.5
27BGPU 服务器 / 云端,追求最高质量3.0984.4

选型规则:先看硬件能跑哪一档,再看你的错误预算。值得注意的是 12B 的 MetricX(3.60)优于参数量两倍的 Gemma 3 27B 基线——在翻译这个边界清晰的任务上,专用训练的效率优势大于参数规模优势。

获取方式与成本

通道成本适合
Hugging Face / Kaggle 下载权重免费(Gemma 条款)本地、NAS、私有 GPU 节点,数据不出域
自建推理服务(Transformers / vLLM 等)硬件 + 电力需要高并发或常驻服务
Vertex AI Model Garden按云资源计费不想自建运维,且数据可上云

两点必须在采购前确认:一是 Gemma 条款含再分发要求与禁用政策,商用前请法务过一遍;二是免费的是权重,不是算力——27B 档的自部署硬件成本并不低。

API 调用示例(本地 Transformers)

from transformers import AutoProcessor, AutoModelForImageTextToText
import torch

model_id = "google/translategemma-4b-it"
processor = AutoProcessor.from_pretrained(model_id)
model = AutoModelForImageTextToText.from_pretrained(
    model_id, torch_dtype=torch.bfloat16, device_map="auto"
)

messages = [
    {
        "role": "user",
        "content": [
            {"type": "text", "source_lang_code": "en", "target_lang_code": "zh-Hans",
             "text": "The warranty does not cover damage caused by unauthorized repair."},
        ],
    }
]

inputs = processor.apply_chat_template(
    messages, tokenize=True, add_generation_prompt=True,
    return_dict=True, return_tensors="pt",
).to(model.device)

out = model.generate(**inputs, max_new_tokens=256)
print(processor.decode(out[0], skip_special_tokens=True))

官方 chat template 要求一次只传一个文本或图片条目,并显式给出 source / target 语言代码;支持地区变体写法(如 en-GBzh-Hans)。

生产落地的检查清单

  1. 先建双语测试集,覆盖术语、人名、数字、格式、歧义、方言与对抗性输入——基准平均分不能代表你的语言对。
  2. 长文档必须切块。 约 2000 token 的输入上限是硬边界,需要自建切块 + 术语表 / 翻译记忆层。
  3. 加兜底与路由。 低置信度结果转人工,法律、医疗、金融、移民等高后果内容必须人工复核。
  4. 做可观测性。 记录每条请求的源语言、目标语言、模型尺寸与耗时,便于定位回归。
  5. 合规前置。 确认 Gemma 条款对你们的使用形式(含再分发)是否允许。

适合 / 不适合

适合

  • 有「数据不出域」硬要求的翻译场景(合同、病历、政务、内部技术资料)
  • 需要在无网络或弱网环境工作的边缘设备与现场作业
  • 想把通用 LLM 的翻译请求分流给更便宜、更可控的专用模型
  • 翻译研究与语言对基准评测
  • 截图、招牌、扫描件中的文字提取与翻译

不适合

  • 需要翻译超长文档且不愿自建切块管线的场景(输入上限约 2000 token)
  • 需要通用推理、工具调用或多轮 Agent 能力的场景
  • 依赖官方确认指标的近 500 个额外语言对(发布时无评测数据)
  • 无法接受 Gemma 条款再分发要求的商用分发

相关阅读

来源

待核实:WMT24++ 的 MetricX 与 COMET 分数引自官方 model card 与第三方整理,「12B 超过 Gemma 3 27B 基线」为官方口径,未见独立复现;近 500 个额外语言对官方明确说明暂无确认评测指标。本卡由 AI 之家 编辑部基于公开资料整理,非厂商付费内容。

相关对比