胜算云 胜算云 文档中心 ↗ 精益社区

什么是 JEV?

决策模型(System One)API:返回类型化决策与校准概率而非生成文本。传入一段状态(state)与一组带类型的问题(questions),单次并行调用即可拿到全部结构化答案,适用于工单路由、紧急度判定、评分与内容审核等高频判断场景。当前已接入 TypeSafe Jev(typesafe/jev-latest)。

今年大多数 AI 产品都在竞相提升对话智能,TypeSafe AI 却走了一条截然不同的路。2026 年 9 月 15 日,该公司发布了 Jev——其首款「System One 模型」。这是一种从不生成句子的 AI:它返回的是类型化的概率决策,代码可以直接对其进行操作。如果你在构建智能体或自动化系统,Jev 值得深入了解——它专门针对那些大语言模型(LLM)处理起来既慢又贵的高频、低价值决策。本文介绍它的定义、工作原理、定价,以及哪些说法值得保持审慎。

一句话说清 Jev 是什么

Jev 是 TypeSafe AI 推出的前沿模型,它接收程序状态和一组类型化问题,在单次并行处理中回答所有问题——返回的是带有校准概率的结构化值,而非生成的文本。

该公司将其定位为一种全新的模型类别,而非更小的 LLM。TypeSafe 将其称为「System One」,借鉴了丹尼尔·卡尼曼(Daniel Kahneman)关于快速直觉型「系统 1」思维与缓慢深思型「系统 2」推理的区分。其核心判断是:软件内部的大多数决策都是快速判断(「这属于哪个类别?」「这件事紧急吗?」),而我们一直在为此租用完整的推理模型。

Jev 由 Diogo Almeida 主导构建,他曾参与 OpenAI 的 RLHF 和 InstructGPT 工作,奠定了 ChatGPT 的技术基础。此次发布获得了由 DCVC 领投的 4000 万美元融资。产品名称致敬经济学家威廉·斯坦利·杰文斯(William Stanley Jevons)——其背后的逻辑是:决策成本越低,决策需求就会爆炸式增长

Jev 与 LLM 的核心区别

核心差异在于输出形式。LLM 逐个 token 生成字符串,你随后需要解析和验证该字符串,并祈祷它没有产生幻觉或返回错误格式。Jev 则预先定义所有可能的答案,并以类型化值的形式返回——因此无需解析,也从根本上杜绝了类型错误。

维度Jev(System One)前沿 LLM
输出类型化决策 + 概率生成文本(字符串)
采样方式并行,单次处理顺序,逐 token 生成
延迟70–500 毫秒(自报数据)秒级
结构化输出错误从根本上为 0%非零
置信度每次回答均经过校准通常过度自信

有两点尤为突出:

第一,并行采样。Jev 同时处理请求中的所有问题,因此增加第十个问题几乎不会改变响应时间。

第二,校准置信度。Jev 采用 TypeSafe 称为「校准决策强化学习」(RLCD,Reinforcement Learning for Calibrated Decisions)的方法训练,针对实际结果而非人类偏好来优化概率。从整体上看,更高的置信度意味着更高的准确率——这正是你判断何时自动执行、何时上报人工的关键依据。

它同样能像 LLM 一样理解自然语言输入,但目前仅支持纯文本——字符串、JSON 或文本数组,暂不支持图像、音频或视频。

三种基本原语

整个 API 只有三种问题类型。这是设计理念,而非功能限制:

  • Choice(选择)——从一组选项(最多 255 个)中选择一个。返回所选项、每个选项的概率以及置信度分数。可添加显式的 other 选项,让模型表达「以上均不符合」。
  • Score(评分)——在你用文字描述的 2 到 10 级量表上定位。返回可落在级别之间的分数(例如 1.4)。
  • Noul(是否)——一个是/否问题,以 0 到 1 之间的单一概率返回。

一次处理支持工单的请求可能在单次调用中同时询问:应由哪个团队处理(Choice)、客户的不满程度(Score)、以及客户是否明确要求退款(Noul)。你的代码随后用普通的 if 语句组合这些类型化答案。TypeSafe 的官方文档将 Jev 定位为「智能 if 语句」——在手写规则过于脆弱的场景下,用于分类、路由、评分、提取或分支。

Jev 的适用场景与局限

Jev 专为针对已知答案集的高频重复决策而生:工单分类、意图路由、内容审核、信息提取、评分,以及对其他模型输出的护栏检查。由于问题并行处理且输出免费,你可以「扇出」式地预先提出所有问题,再由代码决定哪些结果重要。

对于任何需要生成内容的场景,Jev 并不适用:对话、代码生成或推理解释均不在其能力范围内。还有两点局限值得特别说明:

无世界知识。Jev 只了解你传入的状态,无法主动查询任何信息。这一步骤决定了基于它构建的任何工作流的能力上限。
校准是群体属性。TypeSafe 明确指出,校准特性在大量预测中成立——它并不保证任何单次回答的正确性。Jev 仍然可能出错。

定价与速度:细读注意事项

TypeSafe 的核心数据颇为亮眼:输入价格为每百万 token 0.042 美元,输出免费,延迟为 70–500 毫秒,其工作流基准测试的主页宣称比 LLM「快 193.6 倍、便宜 444.6 倍」。

请将这些数据视为厂商声明,而非独立验证结果。TypeSafe 自身也补充了有价值的注意事项:评测在其团队自己的笔记本电脑上于美国西海岸运行;无法证明定价未经补贴;其工作流虽未纳入训练集,但由其内部团队构建。此外,该基准测试以 GPT-6 Astra 和 Fable 5.1 的平均值作为「正确」参考,这本身就引入了对这两个模型的偏向。唯一难以质疑的说法是 0% 类型错误——模式匹配由构造保证,一个反例即可证伪。

Jev 在智能体循环中的定位

对于构建多智能体系统的团队而言,最值得关注的模式是基于置信度的路由。与其为整个系统设置单一的准确率阈值,不如按操作设置阈值,并根据出错代价进行调整:对于廉价的只读决策,在高置信度时自动执行;对于高代价决策,要求确认;当置信度较低时,路由给人工——或交给完整的推理模型处理。

这使 Jev 成为智能体循环中的决策层,而非 LLM 的替代品。一种常见的架构是级联模式:Jev 以低成本完成分类和路由,确定性代码处理力所能及的部分,前沿模型承接少数复杂任务。其价值在于减少昂贵的 LLM 调用次数,并在「机器决策」与「需要人工介入」之间建立清晰、可审计的边界。

总结

Jev 是一个真正与众不同的想法:一种形如函数调用而非聊天机器人的 AI 原语。如果它在厂商自有基准之外同样表现出色,System One 模型有望接管目前尴尬地塞在 LLM 提示词中的数百万个小型判断任务。目前,它仍处于早期访问阶段,仅支持文本,所有性能数据均为自报——前景可期,但尚待验证。正确的做法是在一个范围明确、高频的决策场景中试用,并与现有方案进行实测对比。

在胜算云调用 Jev

胜算云已接入 Jev 决策模型(模型名 typesafe/jev-latest):传入一段状态(state)与一组带类型的问题(questions),单次调用即可拿到全部结构化答案,按 token 计费。完整请求参数、三种问题类型的写法与错误码,见下一篇 决策模型 API

本文转载改编自 Eigent 官方博客 《什么是 Jev?TypeSafe AI 的 System One 模型详解》(2026-09-18 发布),版权归原作者所有,内容以原文为准。