前 OpenAI 研究员推出决策模型 Jev:不生成文本,直接输出结构化判断
2026-09-17 · TypeSafe AI / Business Wire(Morningstar) / The Register 转述 / 腾讯新闻
要点
- 2026-09-15 前 OpenAI 研究员 Diogo Almeida 创办的 TypeSafe AI 结束隐身状态,发布首款模型 Jev 与「System One Models」这一新模型类别。
- Jev 不生成文本。开发者传入一段状态与一组带类型的问题,模型返回选择、评分或概率,供程序直接用于分类、路由、审批或升级;不产出散文、代码或开放式字符串。
- 官方性能口径:端到端响应 70~500 毫秒,最高可比前沿 LLM 快近 200 倍、便宜 400 多倍;行业对 System One 的整体表述是「最高快 100 倍、便宜 100 倍」。
- 定价:输入 0.042 美元 / 百万 token(即 42 美元 / 十亿 token),输出 token 免费。TypeSafe 对比的参照是 GPT-5.6 Terra 的输入 2 美元、输出 12 美元 / 百万 token。
- 同期完成约 4000 万美元种子轮,由 DCVC 领投;创始团队为 Diogo Almeida、Erik Gafni、Sasha Sheng,公司 2024 年创立于旧金山。
- 训练方法 RLCD(Reinforcement Learning for Calibrated Decisions),采用并行采样器:单次提示可并行产出数百个输出,官方称增加问题数量几乎不影响延迟;当前选项基数上限 255。
背景与分析
一、Almeida 在反驳自己参与建立的范式
Diogo Almeida 在 OpenAI 期间参与了 2022 年的 InstructGPT 工作——那项工作把监督微调、人类偏好数据与 RLHF 组合起来,让 GPT-3 更能按人的意图作答,ChatGPT 沿用同一路线,OpenAI 在 GPT-4 贡献者名单中把他列入「Foundational RLHF and InstructGPT work」。
他现在的问题是:「模型在聊天上超人类已经好几年了,那自动化在哪儿?」
这个反问指向一个真实的结构性矛盾。RLHF 优化的目标是「生成让人满意的自然语言回复」,而生产软件需要的不是一段话,是一个可以被程序直接消费的判定。为了拿到这个判定,今天的做法通常是:让模型生成文本 → 要求它输出 JSON → 写解析器 → 写校验 → 处理解析失败重试。这条链路里有延迟、有成本、还有一类难以根除的失败:输出了合法 JSON 但字段值不在预期枚举内。
二、Jev 到底改了什么
| 维度 | 传统 LLM + JSON mode | Jev(官方口径) |
|---|---|---|
| 输出 | 生成字符串(恰好长得像 JSON) | 架构层面保证 schema 匹配 |
| 延迟 | 逐 token 生成,秒级 | 端到端 70~500 毫秒 |
| 并行 | 一个问题一次生成 | 单次提示并行产出数百个输出 |
| 不确定性 | 通常不提供 | 每个决策附带置信度估计 |
| 失败模式 | 编造字段 / 类型错误 / 格式错 | 可能选错,但不该造出无效字段 |
官方给的类比是「前沿智能的函数调用:非结构化状态进,带类型的概率化决策出」。提供的原语包括 Choice(从选项集中选)、Score(打分)、Noul(另一种机器可读响应形式)。
一个官方示例场景:客服系统问 Jev「这笔账单投诉该由哪个部门处理」,Jev 返回的是 billing / 技术支持 / 销售三个选项各自的概率值,而不是一段解释文字。
三、「0% 幻觉」到底是什么意思
这是最容易被误读的一点,必须拆开说。
TypeSafe 宣称 Jev 能做到 0% 幻觉与 0% 类型错误,其含义是:输出被约束在类型化取值与概率之内,因此不会出现「凭空造出一个字段」或「类型不匹配」这类结构性错误。 官方自己也说得很清楚——模型仍然可能给出错误的判断。
换句话说:
- 保证的是:输出结构永远合法,可以直接进程序。
- 不保证的是:这个判断是对的。
这个区分对工程实践的意义很大:在依赖链深处的一个组件,如果它「偶尔返回格式错误」,整条链路都得写降级与重试;如果它「总是返回合法结构但偶尔选错」,你只需要把置信度阈值接上人工审核通道。后者的失败模式是可治理的,前者不是。
四、该保留的怀疑
- 所有性能数据均为厂商自建评测。官网演示中 Jev 用 0.114 秒完成任务,对比 GPT-5.6 Terra 的 8.566 秒——对比的 prompt、质量判定标准、任务集均未公开。
- 发布时没有任何独立第三方评测。
- 「快 200 倍 / 便宜 400 倍」与「快 100 倍 / 便宜 100 倍」两个口径并存,前者来自特定结构化工作流,后者是对 System One 类别的整体表述,不是同一个测量条件下的数字。
- Jev 目前仅对部分开发者开放早期访问(typesafe.ai 候补名单),未公开 GA 时间与 SLA。
- 选项基数上限 255 意味着它不适合超大标签空间的多分类任务。
对开发者的影响
- 先分清两类任务:需要「生成」的还是需要「判定」的。 分类、路由、审核通过与否、护栏检测、意图识别——这些今天用 LLM 做的判定任务,很可能是在为不必要的文本生成付费。把判定类任务单独拎出来做成本对比,是当下最容易拿到收益的优化。
- 置信度比「更好的模型」更值钱。 有了 calibrated confidence,你可以写「置信度 > 0.9 自动执行,否则转人工」这样的策略——这是把 AI 接进关键链路的前提。现有 LLM 也能让模型自评置信度,但校准质量无保证。
- Agent 的工具调用层是最直接的受益场景。 一次工具调用本质是「从一组动作里选一个」——正好是 Choice 原语。幻觉的工具调用参数是很典型的生产事故来源,结构化输出能消除这一类。参见 MCP 与 Agentic Coding。
- 不要急着替换。 Jev 是早期访问、无独立评测、无 SLA。建议以「影子模式」接入:让 Jev 与现有方案并行跑,只记录不生效,用真实流量验证后再切。
- 关注这条路线本身,而不只是这一家公司。 「为机器而非为人设计模型输出」是一个方向判断题——如果成立,今天大量为解析 LLM 输出而写的胶水代码会整层消失。
AI 之家 观点
- 这是本周最值得记录的一条,不是因为 Jev 一定会赢,而是因为它问对了问题。 过去三年整个行业都在优化「模型怎么更好地跟人说话」,但绝大多数 AI 调用其实发生在软件内部,消费方是程序不是人。为程序生成的每一段自然语言都是纯粹的浪费。
- Almeida 的身份让这条路线有了额外分量。 他是让模型「更会聊天」的那条路线的共同缔造者,现在由他来说「这条路对自动化是不够的」,比任何一个旁观者的批评都更有说服力。
- 「0% 幻觉」是危险的表述,尽管它的技术含义是清晰的。 结构合法 ≠ 判断正确。厂商把「不会造字段」包装成「没有幻觉」,容易被下游误读成「不会出错」。正确用法是把置信度阈值当成一等公民,而不是把 0% 当成免检章。
- 真正的价值主张可能不是快 200 倍,而是「可测试」。 一个输出空间受限、附带校准概率、延迟稳定的组件,是可以被纳入单元测试与 CI 门禁的——而这恰恰是今天 LLM 应用最难工程化的一环。参考 Claude Code 的 plugin eval 会看到同一个方向:把 AI 行为变成可测量的数字。
- 短期不构成选型威胁,中期值得押注一个 POC。 无 GA、无第三方评测、早期访问——现在谈替代为时过早。但判定类任务占你 AI 账单的比例越高,这个 POC 的期望收益越大。 建议先统计一下:你的 LLM 调用里,有多少比例最终只取了一个枚举值或布尔值。
相关阅读
- 工具卡:Claude Code · Devin · Factory
- 本期相关:AI 编程周报 2026-09-17 · Gemini 3.8 Live 发布
- 概念:Agentic Coding · MCP · 上下文工程
- 往期资讯:AI 编程周报 2026-09-16 · DeepSeek V4.1-Flash 发布与 V4 Pro 路由切换
来源
- TypeSafe AI Emerges From Stealth With $40M in Funding With New Model for Composable AI — Business Wire(Morningstar)
- TypeSafe Jev: the frontier model built to kill chat — StartupHub
- AI 不一定要「聊天」,OpenAI 前研究员研发只做决策的模型 — 腾讯新闻
- TypeSafe AI Emerges From Stealth With $40 million in Seed Funding — Startup Researcher
待核实:全部性能与成本数字均为 TypeSafe 官方口径,发布时无独立第三方评测;本轮估值约 2 亿美元为媒体报道口径,未经官方确认;选项基数上限、GA 时间与 SLA 均可能随早期访问推进而变动。本资讯由 AI 之家 编辑部整理,非厂商付费内容。