决策模型 Jev 究竟是做什么的?

TypeSafe AI 发布的 Jev 不生成文本,只返回带概率的结构化决策。本文梳理它的三种问题原语、性能与价格口径、一周内的生态采用,以及黑盒与 CJK 弱项等争议。

2026 年 9 月 15 日,TypeSafe AI 发布 Jev,一个不生成任何自然语言文本的模型。它接收一段状态和几个预定义问题,返回带概率的类型化答案,供程序直接消费。发布同日公司宣布 4000 万美元种子轮融资,一周内 API 因请求量过大短暂宕机,Cloudflare、Vercel、LangChain、Pydantic 相继接入。

本文按是什么、团队与技术、性能与价格、生态与采用、局限与争议五部分梳理这个新品类。

Jev 是什么

Jev 是 TypeSafe AI 开发的专有模型,当前版本 jev-1.13.0,以 early access 形式开放。它属于 TypeSafe 定义的新类别 System One model,命名取自卡尼曼《思考,快与慢》中快速直觉的 System 1。Simon Willison 和 Maggie Appleton 等人认为 decision model(决策模型)是更准确的名字。

一次 Jev 请求包含两部分:

组成 内容
state 字符串、JSON 对象或文本数组,描述当前状态
questions 一个或多个带类型的问题

模型在一次并行计算中评估全部问题,所有问题共用同一个 state,返回的答案结构在请求时已经定义完成。答案附带概率分布和置信度,模型无法返回定义之外的值。TypeSafe 据此宣称幻觉和类型错误在 Jev 上不存在,类型错误在数学上不可能出现。

三种问题原语

原语 用途 返回
Choice 从给定选项中选一 选中项、每项概率、置信度
Score 按有序等级打分 分数、等级分布、置信度
Noul 判断陈述真伪 0 到 1 的概率

Noul 这个名字取自 Bernoulli(伯努利分布),TypeSafe CEO 在 Hacker News 上确认了这一点。

与 LLM 的分工

TypeSafe 给出的定位是,LLM 负责开放式推理和文本生成,Jev 负责流程中的快速结构化判断。官方博客用一个对比表概括两者的差异。

维度 前沿 LLM Jev
训练方法 RLHF / RLVR RLCD
输出 字符串,需要解析校验 类型化结构值,无需解析
采样 逐 token 自回归 单次并行
输入价格 $0.20 到 $10 / MTok $0.042 / MTok
输出价格 约为输入的 5 倍 免费
端到端延迟 3 秒到 329 秒 70ms 到 500ms

团队与技术

TypeSafe AI 于 2024 年由 Diogo Almeida、Erik Gafni、Sasha Sheng 创立,总部旧金山,隐身开发约两年。Almeida 在 OpenAI 工作约 4 年,参与 RLHF、InstructGPT、ChatGPT 和 GPT-4 的研究,是 ChatGPT 背后指令跟随方法的构建者之一。他对 TechCrunch 表示,离开的原因是对话模型虽然强大,却对自动化无用,“我们优化的是人类语言,而计算机说另一种语言”。

技术层面公开信息有限:

  • 架构,transformer,具体结构、权重和技术论文均未公布。外界观察者怀疑模型构建在某个 open-weight LLM 之上。
  • 训练数据,全部为合成数据。Almeida 称这是他做过的最好的赌注之一,“比 RLHF 还好”。
  • 训练方法,RLCD(Reinforcement Learning for Calibrated Decisions,校准决策强化学习),优化目标是概率与真实结果的校准程度,而非人类评分员的偏好。
  • 采样方式,并行采样器一次生成全部输出,与逐 token 自回归生成相对。

模型命名来自 19 世纪英国经济学家 William Stanley Jevons。Jevons paradox 描述资源使用效率提升反而导致总消耗增加的现象,TypeSafe 期待机器智能走同样的路径,成本每降一个数量级就解锁数量级更多的用例。

性能与价格

官方给出的核心数字:

指标 数值
输入价格 $0.042 / MTok(每十亿 token 42 美元)
输出价格 免费
端到端延迟 70ms 到 500ms
官方宣称 常规 40 到 200 倍快、40 到 400 倍便宜,峰值 193.6 倍快、444.6 倍便宜

作为参照,OpenAI GPT-5 Nano 的输入价格为 $0.05 / MTok,Jev 比它还低。

数字的口径

TypeSafe 在发布博客中标注了这些数字的边界:

  1. 193.6x 和 444.6x 来自 workflow evals,workflow 由公司 model capabilities 团队的成员设计,官方承认可能存在偏向自家模型的偏差。
  2. 参考答案取 GPT-6 Astra 和 Fable 5.1 的均值,官方承认这使答案偏向 OpenAI 和 Anthropic 的模型。
  3. 官方自评这些加速比“处于真实世界收益的高端”。
  4. 独立媒体 ts2.tech 的报道标题直接写明 445x 成本说法仍是 self-tested(自测),未有第三方复现。

官方另有两点可以较容易验证:延迟和价格本身透明,类型错误不存在有数学保证。

生态与采用

发布一周内的采用情况:

类型 项目 内容
平台集成 Cloudflare Workers AI models/typesafe/jev
平台集成 Vercel 命令安全审查分类器
框架集成 LangChain langchain-typesafe 包
框架集成 Pydantic TypeSafeModel
工具链 Simon Willison llm-typesafe 插件(LLM CLI)
开源复刻 Kev 基于 Qwen 3.5 的 0.8B / 4B / 9B
基准 JevBench 比较 Jev 类决策模型

实际案例有三个:

  • Vercel,工程师 Pranit Sharma 称用 Jev 替换 ChatGPT Luna 5.6 做命令安全审查分类器,速度快 5 到 18 倍,准确率更高。
  • Bryo AI,CTO Nikhil Mudholkar 测试 Jev 与 Gemini 分类商务邮件,Gemini 略准但贵 10 到 20 倍。他特别提到 Jev 返回的置信度是“唯一一个真实概率”,适合自动化工作流。
  • LangChain 官方示例,model routing(按请求复杂度选模型)和 AutoModeMiddleware(工具调用风险门控),后者在 bash 执行前用 Jev 做风险分类。

社区玩法也已经出现,jevchat 让 Jev 逐符号生成聊天文本、jev-leftpad 用 Choice 问题实现 left-pad、jev-2048 让它玩 2048 游戏。发布一周内出现开源复刻和专属基准,说明开发者对这个方向的验证需求真实存在。

Earendil CTO Armin Ronacher 认为竞争对手会很快跟上,“LLM 太便宜太被补贴了,所以人们往往不需要发挥创造力”。

局限与争议

黑盒加深

这是 Simon Willison 在评测中提出的核心批评。LLM 至少可以给出解释,尽管解释本身不可靠;Jev 只返回一个浮点数,判断依据完全不可见。他明确反对用 Jev 给求职者排序,浮点数可能掩盖训练数据中的偏见。他做的湾区城市实验中,Jev 把 Cupertino 评为最好、East Palo Alto 排最末,结果可疑。

校准责任转移

Armin Ronacher 的表述是,Jev“把幻觉问题部分转移给了用户”。返回 50% 概率意味着调用方要自己决定是否采信,返回 95% 才可以行动。模型负责不确定性,代码负责业务政策,两者分离后阈值调整不依赖重新训练,但阈值定在哪里是人的责任。

官方承认的弱项

官方 jaggedness 文档标注 Jev 1.13 在以下方面表现较弱:

  • 数字与日期处理
  • adversarial content(对抗性内容)
  • CJK(中日韩字符),官方文档明确其准确率显著低于英文

第三点与中文场景直接相关,中文业务接入前需要用自有数据验证。

可复现性为零

无技术论文、无公开架构、无第三方基准复现,核心性能数字全部来自厂商自测。厂商在博客中承认了评测偏差,但结论仍依赖自证。

判断框架

评估一个任务是否适合交给 Jev,三个问题:

  1. 任务能否表达成分类、打分或布尔判断,能表达就适合,需要开放生成则不适合。
  2. 概率输出的下游如何消费,调用方必须有明确的阈值策略,否则概率值无法转化为行动。
  3. 中文输入占比多少,CJK 弱项是官方标注的已知限制,中文为主的数据需要先跑评测。

信源