什么是 JEV?
决策模型(System One)API:返回类型化决策与校准概率而非生成文本。传入一段状态(state)与一组带类型的问题(questions),单次并行调用即可拿到全部结构化答案,适用于工单路由、紧急度判定、评分与内容审核等高频判断场景。当前已接入 TypeSafe Jev(typesafe/jev-latest)。
今年大多数 AI 产品都在竞相提升对话智能,TypeSafe AI 却走了一条截然不同的路。2026 年 9 月 15 日,该公司发布了 Jev——其首款「System One 模型」。这是一种从不生成句子的 AI:它返回的是类型化的概率决策,代码可以直接对其进行操作。如果你在构建智能体或自动化系统,Jev 值得深入了解——它专门针对那些大语言模型(LLM)处理起来既慢又贵的高频、低价值决策。本文介绍它的定义、工作原理、定价,以及哪些说法值得保持审慎。
一句话说清 Jev 是什么
Jev 是 TypeSafe AI 推出的前沿模型,它接收程序状态和一组类型化问题,在单次并行处理中回答所有问题——返回的是带有校准概率的结构化值,而非生成的文本。
该公司将其定位为一种全新的模型类别,而非更小的 LLM。TypeSafe 将其称为「System One」,借鉴了丹尼尔·卡尼曼(Daniel Kahneman)关于快速直觉型「系统 1」思维与缓慢深思型「系统 2」推理的区分。其核心判断是:软件内部的大多数决策都是快速判断(「这属于哪个类别?」「这件事紧急吗?」),而我们一直在为此租用完整的推理模型。
Jev 由 Diogo Almeida 主导构建,他曾参与 OpenAI 的 RLHF 和 InstructGPT 工作,奠定了 ChatGPT 的技术基础。此次发布获得了由 DCVC 领投的 4000 万美元融资。产品名称致敬经济学家威廉·斯坦利·杰文斯(William Stanley Jevons)——其背后的逻辑是:决策成本越低,决策需求就会爆炸式增长。
Jev 与 LLM 的核心区别
核心差异在于输出形式。LLM 逐个 token 生成字符串,你随后需要解析和验证该字符串,并祈祷它没有产生幻觉或返回错误格式。Jev 则预先定义所有可能的答案,并以类型化值的形式返回——因此无需解析,也从根本上杜绝了类型错误。
| 维度 | Jev(System One) | 前沿 LLM |
|---|---|---|
| 输出 | 类型化决策 + 概率 | 生成文本(字符串) |
| 采样方式 | 并行,单次处理 | 顺序,逐 token 生成 |
| 延迟 | 70–500 毫秒(自报数据) | 秒级 |
| 结构化输出错误 | 从根本上为 0% | 非零 |
| 置信度 | 每次回答均经过校准 | 通常过度自信 |
有两点尤为突出:
第一,并行采样。Jev 同时处理请求中的所有问题,因此增加第十个问题几乎不会改变响应时间。
第二,校准置信度。Jev 采用 TypeSafe 称为「校准决策强化学习」(RLCD,Reinforcement Learning for Calibrated Decisions)的方法训练,针对实际结果而非人类偏好来优化概率。从整体上看,更高的置信度意味着更高的准确率——这正是你判断何时自动执行、何时上报人工的关键依据。
它同样能像 LLM 一样理解自然语言输入,但目前仅支持纯文本——字符串、JSON 或文本数组,暂不支持图像、音频或视频。
三种基本原语
整个 API 只有三种问题类型。这是设计理念,而非功能限制:
- Choice(选择)——从一组选项(最多 255 个)中选择一个。返回所选项、每个选项的概率以及置信度分数。可添加显式的
other选项,让模型表达「以上均不符合」。 - Score(评分)——在你用文字描述的 2 到 10 级量表上定位。返回可落在级别之间的分数(例如 1.4)。
- Noul(是否)——一个是/否问题,以 0 到 1 之间的单一概率返回。
一次处理支持工单的请求可能在单次调用中同时询问:应由哪个团队处理(Choice)、客户的不满程度(Score)、以及客户是否明确要求退款(Noul)。你的代码随后用普通的 if 语句组合这些类型化答案。TypeSafe 的官方文档将 Jev 定位为「智能 if 语句」——在手写规则过于脆弱的场景下,用于分类、路由、评分、提取或分支。
Jev 的适用场景与局限
Jev 专为针对已知答案集的高频重复决策而生:工单分类、意图路由、内容审核、信息提取、评分,以及对其他模型输出的护栏检查。由于问题并行处理且输出免费,你可以「扇出」式地预先提出所有问题,再由代码决定哪些结果重要。
对于任何需要生成内容的场景,Jev 并不适用:对话、代码生成或推理解释均不在其能力范围内。还有两点局限值得特别说明:
定价与速度:细读注意事项
TypeSafe 的核心数据颇为亮眼:输入价格为每百万 token 0.042 美元,输出免费,延迟为 70–500 毫秒,其工作流基准测试的主页宣称比 LLM「快 193.6 倍、便宜 444.6 倍」。
请将这些数据视为厂商声明,而非独立验证结果。TypeSafe 自身也补充了有价值的注意事项:评测在其团队自己的笔记本电脑上于美国西海岸运行;无法证明定价未经补贴;其工作流虽未纳入训练集,但由其内部团队构建。此外,该基准测试以 GPT-6 Astra 和 Fable 5.1 的平均值作为「正确」参考,这本身就引入了对这两个模型的偏向。唯一难以质疑的说法是 0% 类型错误——模式匹配由构造保证,一个反例即可证伪。
Jev 在智能体循环中的定位
对于构建多智能体系统的团队而言,最值得关注的模式是基于置信度的路由。与其为整个系统设置单一的准确率阈值,不如按操作设置阈值,并根据出错代价进行调整:对于廉价的只读决策,在高置信度时自动执行;对于高代价决策,要求确认;当置信度较低时,路由给人工——或交给完整的推理模型处理。
这使 Jev 成为智能体循环中的决策层,而非 LLM 的替代品。一种常见的架构是级联模式:Jev 以低成本完成分类和路由,确定性代码处理力所能及的部分,前沿模型承接少数复杂任务。其价值在于减少昂贵的 LLM 调用次数,并在「机器决策」与「需要人工介入」之间建立清晰、可审计的边界。
总结
Jev 是一个真正与众不同的想法:一种形如函数调用而非聊天机器人的 AI 原语。如果它在厂商自有基准之外同样表现出色,System One 模型有望接管目前尴尬地塞在 LLM 提示词中的数百万个小型判断任务。目前,它仍处于早期访问阶段,仅支持文本,所有性能数据均为自报——前景可期,但尚待验证。正确的做法是在一个范围明确、高频的决策场景中试用,并与现有方案进行实测对比。
在胜算云调用 Jev
胜算云已接入 Jev 决策模型(模型名 typesafe/jev-latest):传入一段状态(state)与一组带类型的问题(questions),单次调用即可拿到全部结构化答案,按 token 计费。完整请求参数、三种问题类型的写法与错误码,见下一篇 决策模型 API。