发布日期:2026-09-20 | 话题:Jev / TypeSafe AI / System One 模型 / AI 自动化决策

Jev 是 TypeSafe AI 于 2026 年 9 月 15 日发布的首个"System One 模型",由 ChatGPT 核心技术 RLHF 的早期贡献者、前 OpenAI 研究员 Diogo Almeida 创办的团队在两年隐身研发后推出,它不生成任何文字,只接收非结构化状态并返回带校准概率的类型化决策,用于分类、路由、打分、真伪判断等"智能 if 语句"场景。官方称其端到端延迟 70 至 500 毫秒,比前沿大模型快 40 至 200 倍,输入每百万 Token 0.042 美元、输出免费。独立测试显示 Jev 在分类一致率上与 DeepSeek V4.1 Flash 相当、中位延迟 0.32 秒且概率校准方向全部正确,但它不能解释理由、技术细节封闭、基准由官方自评。本文解释 Jev 的工作原理、三种原语、定价、独立实测结果、适用与不适用场景,以及它与大模型的互补关系。


Jev 是什么:一个"前沿智能的函数调用"

Jev 是 TypeSafe AI 推出的决策模型,创始人 Diogo Almeida 在官方博客中将它定义为"a frontier-intelligence function call:非结构化状态进,类型化概率决策出"。它与 ChatGPT、Claude 等大语言模型的根本区别在于不生成字符串,只从开发者预先定义的类型中选择答案,因此官方称它"不会产生类型错误意义上的幻觉"。

TypeSafe 把这类模型命名为 System One 模型,取自心理学家 Daniel Kahneman 在《思考,快与慢》中对"系统一"(快速直觉)与"系统二"(慢速推理)的区分。模型名 Jev 则来自经济学家 William Stanley Jevons,暗示"效率提升会扩大需求"的杰文斯悖论。

Jev 的四个核心特征:

  • 输出:只返回预定义类型的结构化值,不写任何文本。

  • 采样:所有输出并行一次生成,而非逐 Token 自回归。

  • 置信度:每个答案附带经校准的概率或置信分数。

  • 训练:使用 TypeSafe 自研的 RLCD(Reinforcement Learning for Calibrated Decisions,面向校准决策的强化学习),优化目标是"带诚实概率的答案",而非 RLHF 的人类偏好。

TypeSafe AI 是谁

TypeSafe AI 是 Diogo Almeida 于 2024 年离开 OpenAI 后创办的 AI 实验室,自述定位为"面向自动化的机器原生智能基础设施"。据网易智能与 IT 之家 2026 年 9 月的报道,Almeida 是 2022 年 InstructGPT 论文的共同作者之一,参与了 OpenAI 早期 RLHF 与 GPT-4 相关工作。公司隐身两年后于 2026 年 9 月首次公开,多家中文媒体提到其融资额为 4000 万美元,轮次与投资方未见披露。

Almeida 在发布博客中提出的核心问题是:"模型在聊天上超越人类已有多年,自动化在哪里?"他的判断是 AI 缺少"软件可以依赖的接口",Jev 就是这一接口的第一个实现。

Jev 怎么用:三种原语与一次调用

Jev 的 API 只做一件事:发送一份状态(state)和若干类型化问题(questions),并行返回每个问题的结构化答案。据 TypeSafe 官方文档,三种问题原语可在同一次调用中混用:

原语

用途

返回字段

Choice

从最多 255 个选项中选一个

choice、probabilities、confidence

Score

按评分标准给状态打分

score、probabilities、confidence

Noul

判断一条陈述是否为真

noul(0 到 1 的概率)

官方设计原则是每个问题必须是原子的单维度判断,复杂逻辑拆成多个问题后在代码中组合。选项超过 255 个时采用两阶段模式:先独立打分,再显式选择。

TypeSafe 同时开源了一个适配器 system-one-adapter-python,可用同一套 Choice、Score、Noul 接口调用 OpenAI 或 Anthropic 兼容的大模型,便于开发者在成本、速度、准确率上做同题对比。据 GitHub 数据,该仓库创建于 2026 年 8 月 8 日,截至 9 月 20 日有 179 个星标;社区另有 mini-jev、open-alternative-jev 等在本地大模型上模拟 Jev 接口的项目。

定价与速度:输出免费,延迟毫秒级

Jev 目前处于早期访问阶段,通过候补名单逐步开放,服务部署于美国西海岸。据官方博客 2026 年 9 月数据:

指标

Jev

官方给出的前沿大模型参考

输入价格(每百万 Token)

0.042 美元

0.20 至 10 美元

输出价格

免费

约为输入的 5 倍

端到端延迟

70 至 500 毫秒

3 至 329 秒

官方自建工作流评测

最高快 193.6 倍、便宜 444.6 倍

参考概率取 GPT-6 Astra 与 Fable 5.1 平均值

官方承认 193.6 倍与 444.6 倍是"实际收益的上限",且四个评测工作流由公司内部能力团队编写。第三方模型网关 OpenCode Zen 已上架 jev-1.13 与免费版 jev-1.13-free,定价与官方一致。

独立实测:一致率持平大模型,校准是真实卖点

挪威开发者 Emil Lindfors 于 2026 年 9 月 18 日发布了对 jev-1.13.0 的早期访问测试,是目前少数非官方数据。测试用 24 份挪威语公众听证回复、每份 11 个问题,以 Fable 5.1 盲标两遍作为参考标签,对比经 OpenRouter 调用的 DeepSeek V4.1 Flash。

指标

Jev

DeepSeek V4.1 Flash(关推理)

DeepSeek V4.1 Flash(开推理)

中位延迟

0.32 秒

2.7 秒

26 秒

最慢请求

1.3 秒

17.9 秒

250 秒

每 1000 份文档成本

0.22 美元

1.31 美元

3.08 美元

立场分类一致

20/24

20/24

22/24

论点判断一致率(192 项)

0.86

0.89

0.88

实质性精确分级一致

19/24

14/24

14/24

作者的结论有三点。第一,在 24 份样本下立场与论点三列在统计上无差别,开推理只多换来 2 个标签、代价是十倍延迟。第二,Jev 的概率校准方向全部正确:论点判断中概率落在 0.9 到 1.0 区间的 43 次,参考标签为"是"的比例为 98%;落在 0.0 到 0.1 区间的 14 次,比例为 0%。对照 DeepSeek 开推理时自述置信度 0.7 到 0.9 的判断,参考只同意 48%。第三,Jev 对措辞敏感,把问题写得越谨慎间接,一致率越低,官方已知弱点页也注明模型"按字面读指令"。

适合与不适合 Jev 的场景

Jev 适合需要高频、低延迟、可编程消费的判断型任务,不适合任何需要生成或解释文本的任务。据官方博客与独立测试归纳:

适合

  1. 工作流分支:邮件是否投诉、紧急程度、转给哪个部门,一次调用三个问题同时返回。

  2. 大规模批处理:对海量文档做 map-reduce 式分类打分,每千份文档成本以美分计。

  3. 实时应用:官方 Doom 机器人演示每秒约 10 次查询、每小时约 7 美元。

  4. 大模型输出的评分与护栏:对 LLM 回答做质量评分、越狱检测、路由判断。

不适合

  • 需要自然语言解释的强监管场景,Jev 只给数字不给理由,金融、医疗、法律合规审查往往要求可追溯的推理链。

  • 图像输入,官方注明"暂不支持图片"。

  • 非英语长文本,官方称模型"擅长英语、其他语言准确率不一",独立测试发现挪威语每 Token 约 2.06 字符,32K 状态上限只能装约 6.4 万字符。

在实际系统里 Jev 与大模型是互补而非替代关系:Jev 负责路由、判断和打分,大模型负责生成内容。构建这类混合流水线时,开发者通常需要同时接入多款生成模型,七牛云 AI 大模型广场提供多款主流大模型的统一接入,其 Token Plan 按用量计费。

争议:范式转变还是公关叙事

Jev 发布后在海外社交媒体热度一度超过同期的 Gemini 4 Pro 泄露事件,但质疑同样集中。据品玩、IT 时代网等中文媒体 2026 年 9 月 17 至 18 日的分析:

  • 可解释性缺失:输出只有选项和概率,无法说明理由。

  • 技术细节封闭:RLCD 的奖励函数、网络架构、校准方法均未公开,参数量和上下文长度也未披露。

  • 基准不独立:所有官方分数来自内部评测,参考答案由 GPT-6 Astra 与 Fable 5.1 取平均,被认为"带有公关色彩"。

  • 商业模式待验证:输出免费、输入每百万 Token 0.042 美元被质疑以融资补贴价格,高并发下能否维持低延迟尚无数据。

Almeida 在博客中的回应是"非凡的主张需要非凡的证据",并公开了四个评测工作流供复现,同时表示"我们喜欢怀疑者,我们自己也是怀疑者"。

常见问题

Jev 是大语言模型吗?

不是。Jev 不做自回归文本生成,官方将其归为 System One 模型,是与 LLM 并列的新模型类别。它能读非结构化文本,但只输出预定义类型的决策和概率。

Jev 会取代 GPT、Claude 这类模型吗?

不会,二者解决不同问题。Jev 只做判断,不能写代码、写文章或对话。官方定位是让 Jev 处理自动化流水线中的决策节点,生成任务仍交给大模型。

Jev 现在能用吗?

处于早期访问阶段,需在 TypeSafe 控制台加入候补名单。第三方网关 OpenCode Zen 已上架 jev-1.13 及其免费版本,可作为试用入口。

Jev 的"不会幻觉"是什么意思?

指类型层面的保证:答案只能是 schema 里定义的值,不会出现格式错误或凭空编造的选项。它仍然可能选错,官方以概率校准而非"永远正确"作为可靠性主张。

Jev 和 OpenAI 的结构化输出功能有什么区别?

结构化输出是让 LLM 逐 Token 生成符合 schema 的 JSON,仍是自回归过程,延迟以秒计且概率不校准。Jev 是并行一次采样所有答案并附带校准概率,延迟以毫秒计,但代价是完全放弃文本生成。

总结

Jev 是 2026 年 9 月最受关注的非 LLM 模型发布,它用"只输出类型化决策与校准概率"换取了毫秒级延迟和接近免费的输出成本,独立测试初步印证了速度、成本和校准三项主张,而准确率与前沿大模型大致持平。它的价值不在替代大模型,而在填补自动化系统中"软件可以直接依赖的判断接口"这一空缺。本文信息来自 TypeSafe AI 官方博客与文档、Emil Lindfors 2026 年 9 月 18 日独立测试、GitHub 仓库数据及同期中文媒体报道,Jev 仍处早期访问阶段,规格与定价可能调整。

延伸阅读