爆火的Jev 是什么:前 OpenAI 研究员做的"不说话"模型,只输出带概率的结构化决策
发布日期:2026-09-20 | 话题:Jev / TypeSafe AI / System One 模型 / AI 自动化决策
Jev 是 TypeSafe AI 于 2026 年 9 月 15 日发布的首个"System One 模型",由 ChatGPT 核心技术 RLHF 的早期贡献者、前 OpenAI 研究员 Diogo Almeida 创办的团队在两年隐身研发后推出,它不生成任何文字,只接收非结构化状态并返回带校准概率的类型化决策,用于分类、路由、打分、真伪判断等"智能 if 语句"场景。官方称其端到端延迟 70 至 500 毫秒,比前沿大模型快 40 至 200 倍,输入每百万 Token 0.042 美元、输出免费。独立测试显示 Jev 在分类一致率上与 DeepSeek V4.1 Flash 相当、中位延迟 0.32 秒且概率校准方向全部正确,但它不能解释理由、技术细节封闭、基准由官方自评。本文解释 Jev 的工作原理、三种原语、定价、独立实测结果、适用与不适用场景,以及它与大模型的互补关系。
Jev 是什么:一个"前沿智能的函数调用"
Jev 是 TypeSafe AI 推出的决策模型,创始人 Diogo Almeida 在官方博客中将它定义为"a frontier-intelligence function call:非结构化状态进,类型化概率决策出"。它与 ChatGPT、Claude 等大语言模型的根本区别在于不生成字符串,只从开发者预先定义的类型中选择答案,因此官方称它"不会产生类型错误意义上的幻觉"。
TypeSafe 把这类模型命名为 System One 模型,取自心理学家 Daniel Kahneman 在《思考,快与慢》中对"系统一"(快速直觉)与"系统二"(慢速推理)的区分。模型名 Jev 则来自经济学家 William Stanley Jevons,暗示"效率提升会扩大需求"的杰文斯悖论。
Jev 的四个核心特征:
输出:只返回预定义类型的结构化值,不写任何文本。
采样:所有输出并行一次生成,而非逐 Token 自回归。
置信度:每个答案附带经校准的概率或置信分数。
训练:使用 TypeSafe 自研的 RLCD(Reinforcement Learning for Calibrated Decisions,面向校准决策的强化学习),优化目标是"带诚实概率的答案",而非 RLHF 的人类偏好。
TypeSafe AI 是谁
TypeSafe AI 是 Diogo Almeida 于 2024 年离开 OpenAI 后创办的 AI 实验室,自述定位为"面向自动化的机器原生智能基础设施"。据网易智能与 IT 之家 2026 年 9 月的报道,Almeida 是 2022 年 InstructGPT 论文的共同作者之一,参与了 OpenAI 早期 RLHF 与 GPT-4 相关工作。公司隐身两年后于 2026 年 9 月首次公开,多家中文媒体提到其融资额为 4000 万美元,轮次与投资方未见披露。
Almeida 在发布博客中提出的核心问题是:"模型在聊天上超越人类已有多年,自动化在哪里?"他的判断是 AI 缺少"软件可以依赖的接口",Jev 就是这一接口的第一个实现。
Jev 怎么用:三种原语与一次调用
Jev 的 API 只做一件事:发送一份状态(state)和若干类型化问题(questions),并行返回每个问题的结构化答案。据 TypeSafe 官方文档,三种问题原语可在同一次调用中混用:
官方设计原则是每个问题必须是原子的单维度判断,复杂逻辑拆成多个问题后在代码中组合。选项超过 255 个时采用两阶段模式:先独立打分,再显式选择。
TypeSafe 同时开源了一个适配器 system-one-adapter-python,可用同一套 Choice、Score、Noul 接口调用 OpenAI 或 Anthropic 兼容的大模型,便于开发者在成本、速度、准确率上做同题对比。据 GitHub 数据,该仓库创建于 2026 年 8 月 8 日,截至 9 月 20 日有 179 个星标;社区另有 mini-jev、open-alternative-jev 等在本地大模型上模拟 Jev 接口的项目。
定价与速度:输出免费,延迟毫秒级
Jev 目前处于早期访问阶段,通过候补名单逐步开放,服务部署于美国西海岸。据官方博客 2026 年 9 月数据:
官方承认 193.6 倍与 444.6 倍是"实际收益的上限",且四个评测工作流由公司内部能力团队编写。第三方模型网关 OpenCode Zen 已上架 jev-1.13 与免费版 jev-1.13-free,定价与官方一致。
独立实测:一致率持平大模型,校准是真实卖点
挪威开发者 Emil Lindfors 于 2026 年 9 月 18 日发布了对 jev-1.13.0 的早期访问测试,是目前少数非官方数据。测试用 24 份挪威语公众听证回复、每份 11 个问题,以 Fable 5.1 盲标两遍作为参考标签,对比经 OpenRouter 调用的 DeepSeek V4.1 Flash。
作者的结论有三点。第一,在 24 份样本下立场与论点三列在统计上无差别,开推理只多换来 2 个标签、代价是十倍延迟。第二,Jev 的概率校准方向全部正确:论点判断中概率落在 0.9 到 1.0 区间的 43 次,参考标签为"是"的比例为 98%;落在 0.0 到 0.1 区间的 14 次,比例为 0%。对照 DeepSeek 开推理时自述置信度 0.7 到 0.9 的判断,参考只同意 48%。第三,Jev 对措辞敏感,把问题写得越谨慎间接,一致率越低,官方已知弱点页也注明模型"按字面读指令"。
适合与不适合 Jev 的场景
Jev 适合需要高频、低延迟、可编程消费的判断型任务,不适合任何需要生成或解释文本的任务。据官方博客与独立测试归纳:
适合
工作流分支:邮件是否投诉、紧急程度、转给哪个部门,一次调用三个问题同时返回。
大规模批处理:对海量文档做 map-reduce 式分类打分,每千份文档成本以美分计。
实时应用:官方 Doom 机器人演示每秒约 10 次查询、每小时约 7 美元。
大模型输出的评分与护栏:对 LLM 回答做质量评分、越狱检测、路由判断。
不适合
需要自然语言解释的强监管场景,Jev 只给数字不给理由,金融、医疗、法律合规审查往往要求可追溯的推理链。
图像输入,官方注明"暂不支持图片"。
非英语长文本,官方称模型"擅长英语、其他语言准确率不一",独立测试发现挪威语每 Token 约 2.06 字符,32K 状态上限只能装约 6.4 万字符。
在实际系统里 Jev 与大模型是互补而非替代关系:Jev 负责路由、判断和打分,大模型负责生成内容。构建这类混合流水线时,开发者通常需要同时接入多款生成模型,七牛云 AI 大模型广场提供多款主流大模型的统一接入,其 Token Plan 按用量计费。
争议:范式转变还是公关叙事
Jev 发布后在海外社交媒体热度一度超过同期的 Gemini 4 Pro 泄露事件,但质疑同样集中。据品玩、IT 时代网等中文媒体 2026 年 9 月 17 至 18 日的分析:
可解释性缺失:输出只有选项和概率,无法说明理由。
技术细节封闭:RLCD 的奖励函数、网络架构、校准方法均未公开,参数量和上下文长度也未披露。
基准不独立:所有官方分数来自内部评测,参考答案由 GPT-6 Astra 与 Fable 5.1 取平均,被认为"带有公关色彩"。
商业模式待验证:输出免费、输入每百万 Token 0.042 美元被质疑以融资补贴价格,高并发下能否维持低延迟尚无数据。
Almeida 在博客中的回应是"非凡的主张需要非凡的证据",并公开了四个评测工作流供复现,同时表示"我们喜欢怀疑者,我们自己也是怀疑者"。
常见问题
Jev 是大语言模型吗?
不是。Jev 不做自回归文本生成,官方将其归为 System One 模型,是与 LLM 并列的新模型类别。它能读非结构化文本,但只输出预定义类型的决策和概率。
Jev 会取代 GPT、Claude 这类模型吗?
不会,二者解决不同问题。Jev 只做判断,不能写代码、写文章或对话。官方定位是让 Jev 处理自动化流水线中的决策节点,生成任务仍交给大模型。
Jev 现在能用吗?
处于早期访问阶段,需在 TypeSafe 控制台加入候补名单。第三方网关 OpenCode Zen 已上架 jev-1.13 及其免费版本,可作为试用入口。
Jev 的"不会幻觉"是什么意思?
指类型层面的保证:答案只能是 schema 里定义的值,不会出现格式错误或凭空编造的选项。它仍然可能选错,官方以概率校准而非"永远正确"作为可靠性主张。
Jev 和 OpenAI 的结构化输出功能有什么区别?
结构化输出是让 LLM 逐 Token 生成符合 schema 的 JSON,仍是自回归过程,延迟以秒计且概率不校准。Jev 是并行一次采样所有答案并附带校准概率,延迟以毫秒计,但代价是完全放弃文本生成。
总结
Jev 是 2026 年 9 月最受关注的非 LLM 模型发布,它用"只输出类型化决策与校准概率"换取了毫秒级延迟和接近免费的输出成本,独立测试初步印证了速度、成本和校准三项主张,而准确率与前沿大模型大致持平。它的价值不在替代大模型,而在填补自动化系统中"软件可以直接依赖的判断接口"这一空缺。本文信息来自 TypeSafe AI 官方博客与文档、Emil Lindfors 2026 年 9 月 18 日独立测试、GitHub 仓库数据及同期中文媒体报道,Jev 仍处早期访问阶段,规格与定价可能调整。
延伸阅读
TypeSafe AI 官方发布博客:https://typesafe.ai/blog/introducing-system-one-models-and-jev
TypeSafe 官方文档:https://docs.typesafe.ai/
TypeSafe 公开评测:https://evals.typesafe.ai
开源适配器 system-one-adapter-python:https://github.com/typesafe-ai/system-one-adapter-python
七牛云 AI 大模型广场:https://www.qiniu.com/ai/models
七牛云 Token Plan:https://www.qiniu.com/ai/plan