跳到主内容

前 OpenAI 研究员推出决策模型 Jev:不生成文本,直接输出结构化判断

2026-09-17 · TypeSafe AI / Business Wire(Morningstar) / The Register 转述 / 腾讯新闻

要点

  • 2026-09-15 前 OpenAI 研究员 Diogo Almeida 创办的 TypeSafe AI 结束隐身状态,发布首款模型 Jev 与「System One Models」这一新模型类别。
  • Jev 不生成文本。开发者传入一段状态与一组带类型的问题,模型返回选择、评分或概率,供程序直接用于分类、路由、审批或升级;不产出散文、代码或开放式字符串
  • 官方性能口径:端到端响应 70~500 毫秒,最高可比前沿 LLM 快近 200 倍、便宜 400 多倍;行业对 System One 的整体表述是「最高快 100 倍、便宜 100 倍」。
  • 定价:输入 0.042 美元 / 百万 token(即 42 美元 / 十亿 token),输出 token 免费。TypeSafe 对比的参照是 GPT-5.6 Terra 的输入 2 美元、输出 12 美元 / 百万 token。
  • 同期完成约 4000 万美元种子轮,由 DCVC 领投;创始团队为 Diogo Almeida、Erik Gafni、Sasha Sheng,公司 2024 年创立于旧金山。
  • 训练方法 RLCD(Reinforcement Learning for Calibrated Decisions),采用并行采样器:单次提示可并行产出数百个输出,官方称增加问题数量几乎不影响延迟;当前选项基数上限 255

背景与分析

一、Almeida 在反驳自己参与建立的范式

Diogo Almeida 在 OpenAI 期间参与了 2022 年的 InstructGPT 工作——那项工作把监督微调、人类偏好数据与 RLHF 组合起来,让 GPT-3 更能按人的意图作答,ChatGPT 沿用同一路线,OpenAI 在 GPT-4 贡献者名单中把他列入「Foundational RLHF and InstructGPT work」。

他现在的问题是:「模型在聊天上超人类已经好几年了,那自动化在哪儿?」

这个反问指向一个真实的结构性矛盾。RLHF 优化的目标是「生成让人满意的自然语言回复」,而生产软件需要的不是一段话,是一个可以被程序直接消费的判定。为了拿到这个判定,今天的做法通常是:让模型生成文本 → 要求它输出 JSON → 写解析器 → 写校验 → 处理解析失败重试。这条链路里有延迟、有成本、还有一类难以根除的失败:输出了合法 JSON 但字段值不在预期枚举内。

二、Jev 到底改了什么

维度传统 LLM + JSON modeJev(官方口径)
输出生成字符串(恰好长得像 JSON)架构层面保证 schema 匹配
延迟逐 token 生成,秒级端到端 70~500 毫秒
并行一个问题一次生成单次提示并行产出数百个输出
不确定性通常不提供每个决策附带置信度估计
失败模式编造字段 / 类型错误 / 格式错可能选错,但不该造出无效字段

官方给的类比是「前沿智能的函数调用:非结构化状态进,带类型的概率化决策出」。提供的原语包括 Choice(从选项集中选)、Score(打分)、Noul(另一种机器可读响应形式)。

一个官方示例场景:客服系统问 Jev「这笔账单投诉该由哪个部门处理」,Jev 返回的是 billing / 技术支持 / 销售三个选项各自的概率值,而不是一段解释文字。

三、「0% 幻觉」到底是什么意思

这是最容易被误读的一点,必须拆开说。

TypeSafe 宣称 Jev 能做到 0% 幻觉与 0% 类型错误,其含义是:输出被约束在类型化取值与概率之内,因此不会出现「凭空造出一个字段」或「类型不匹配」这类结构性错误。 官方自己也说得很清楚——模型仍然可能给出错误的判断

换句话说:

  • 保证的是:输出结构永远合法,可以直接进程序。
  • 不保证的是:这个判断是对的。

这个区分对工程实践的意义很大:在依赖链深处的一个组件,如果它「偶尔返回格式错误」,整条链路都得写降级与重试;如果它「总是返回合法结构但偶尔选错」,你只需要把置信度阈值接上人工审核通道。后者的失败模式是可治理的,前者不是。

四、该保留的怀疑

  • 所有性能数据均为厂商自建评测。官网演示中 Jev 用 0.114 秒完成任务,对比 GPT-5.6 Terra 的 8.566 秒——对比的 prompt、质量判定标准、任务集均未公开
  • 发布时没有任何独立第三方评测。
  • 「快 200 倍 / 便宜 400 倍」与「快 100 倍 / 便宜 100 倍」两个口径并存,前者来自特定结构化工作流,后者是对 System One 类别的整体表述,不是同一个测量条件下的数字
  • Jev 目前仅对部分开发者开放早期访问(typesafe.ai 候补名单),未公开 GA 时间与 SLA
  • 选项基数上限 255 意味着它不适合超大标签空间的多分类任务。

对开发者的影响

  • 先分清两类任务:需要「生成」的还是需要「判定」的。 分类、路由、审核通过与否、护栏检测、意图识别——这些今天用 LLM 做的判定任务,很可能是在为不必要的文本生成付费。把判定类任务单独拎出来做成本对比,是当下最容易拿到收益的优化。
  • 置信度比「更好的模型」更值钱。 有了 calibrated confidence,你可以写「置信度 > 0.9 自动执行,否则转人工」这样的策略——这是把 AI 接进关键链路的前提。现有 LLM 也能让模型自评置信度,但校准质量无保证。
  • Agent 的工具调用层是最直接的受益场景。 一次工具调用本质是「从一组动作里选一个」——正好是 Choice 原语。幻觉的工具调用参数是很典型的生产事故来源,结构化输出能消除这一类。参见 MCPAgentic Coding
  • 不要急着替换。 Jev 是早期访问、无独立评测、无 SLA。建议以「影子模式」接入:让 Jev 与现有方案并行跑,只记录不生效,用真实流量验证后再切。
  • 关注这条路线本身,而不只是这一家公司。 「为机器而非为人设计模型输出」是一个方向判断题——如果成立,今天大量为解析 LLM 输出而写的胶水代码会整层消失

AI 之家 观点

  1. 这是本周最值得记录的一条,不是因为 Jev 一定会赢,而是因为它问对了问题。 过去三年整个行业都在优化「模型怎么更好地跟人说话」,但绝大多数 AI 调用其实发生在软件内部,消费方是程序不是人。为程序生成的每一段自然语言都是纯粹的浪费。
  2. Almeida 的身份让这条路线有了额外分量。 他是让模型「更会聊天」的那条路线的共同缔造者,现在由他来说「这条路对自动化是不够的」,比任何一个旁观者的批评都更有说服力
  3. 「0% 幻觉」是危险的表述,尽管它的技术含义是清晰的。 结构合法 ≠ 判断正确。厂商把「不会造字段」包装成「没有幻觉」,容易被下游误读成「不会出错」。正确用法是把置信度阈值当成一等公民,而不是把 0% 当成免检章。
  4. 真正的价值主张可能不是快 200 倍,而是「可测试」。 一个输出空间受限、附带校准概率、延迟稳定的组件,是可以被纳入单元测试与 CI 门禁的——而这恰恰是今天 LLM 应用最难工程化的一环。参考 Claude Code 的 plugin eval 会看到同一个方向:把 AI 行为变成可测量的数字
  5. 短期不构成选型威胁,中期值得押注一个 POC。 无 GA、无第三方评测、早期访问——现在谈替代为时过早。但判定类任务占你 AI 账单的比例越高,这个 POC 的期望收益越大。 建议先统计一下:你的 LLM 调用里,有多少比例最终只取了一个枚举值或布尔值。

相关阅读

来源

待核实:全部性能与成本数字均为 TypeSafe 官方口径,发布时无独立第三方评测;本轮估值约 2 亿美元为媒体报道口径,未经官方确认;选项基数上限、GA 时间与 SLA 均可能随早期访问推进而变动。本资讯由 AI 之家 编辑部整理,非厂商付费内容。

相关对比

Aider vs Claude Code:终端 AI 编程双雄怎么选

Aider vs Claude Code 2026 选型对比:开源 BYOK 多模型 vs Anthropic 订阅长任务 Agent,从编程能力、多模型支持、价格、Git 集成、国内可用性和适合人群判断,帮你选对终端 AI 编程工具。

Claude Code vs Cline:CLI AI Agent 怎么选?2026 对比

Claude Code vs Cline 2026 选型对比:Anthropic 官方闭源 CLI Agent vs Apache-2.0 开源 VS Code 插件。从模型绑定、工作流、MCP 支持、价格、隐私和适合人群 6 个维度帮你选对 CLI AI 编程工具。

Claude Code vs Codex CLI:终端 AI Agent 双雄对比

Claude Code vs Codex CLI 2026 选型对比:Anthropic 与 OpenAI 两大官方终端 Agent 的模型、长任务、MCP 生态、Windows 支持、订阅打包价格和国内可用性全方位对比,帮你判断该用哪个终端 AI Agent,以及能不能两个一起用。

Claude Code vs Crush:Anthropic 官方 vs 多模型 TUI(2026 实测选型)

Claude Code vs Crush 2026 选型对比:Anthropic 官方 CLI Agent(Claude only + 长任务最稳 + MCP 一等公民)vs Charmbracelet 开源 TUI Agent(多模型 mid-session 切换 + LSP + FSL-1.1-MIT)。从模型、长任务、生态、价格、国内可用性帮你选对终端 AI 编程工具。

Claude Code vs Gemini CLI:终端 AI Agent 怎么选?(2026 选型指南)

Claude Code 和 Gemini CLI 都是终端原生的 AI 编码 Agent。一句话结论 + 决策树 + 价格 + 国内可用性对比:长任务与 CLAUDE.md 生态选前者,免费额度与接入门槛选后者。

Cursor vs Claude Code:什么时候用哪个?(2026 实测选型)

Cursor 和 Claude Code 到底怎么选?一句话结论 + 决策树 + 价格实测 + 国内可用性对比。GUI 派选 Cursor,终端长任务派选 Claude Code,最优解其实是共存。

相关评测