2026 年 9 月 15 日,TypeSafe AI 发布 Jev,一个不生成任何自然语言文本的模型。它接收一段状态和几个预定义问题,返回带概率的类型化答案,供程序直接消费。发布同日公司宣布 4000 万美元种子轮融资,一周内 API 因请求量过大短暂宕机,Cloudflare、Vercel、LangChain、Pydantic 相继接入。
本文按是什么、团队与技术、性能与价格、生态与采用、局限与争议五部分梳理这个新品类。
Jev 是什么
Jev 是 TypeSafe AI 开发的专有模型,当前版本 jev-1.13.0,以 early access 形式开放。它属于 TypeSafe 定义的新类别 System One model,命名取自卡尼曼《思考,快与慢》中快速直觉的 System 1。Simon Willison 和 Maggie Appleton 等人认为 decision model(决策模型)是更准确的名字。
一次 Jev 请求包含两部分:
| 组成 | 内容 |
|---|---|
| state | 字符串、JSON 对象或文本数组,描述当前状态 |
| questions | 一个或多个带类型的问题 |
模型在一次并行计算中评估全部问题,所有问题共用同一个 state,返回的答案结构在请求时已经定义完成。答案附带概率分布和置信度,模型无法返回定义之外的值。TypeSafe 据此宣称幻觉和类型错误在 Jev 上不存在,类型错误在数学上不可能出现。
三种问题原语
| 原语 | 用途 | 返回 |
|---|---|---|
| Choice | 从给定选项中选一 | 选中项、每项概率、置信度 |
| Score | 按有序等级打分 | 分数、等级分布、置信度 |
| Noul | 判断陈述真伪 | 0 到 1 的概率 |
Noul 这个名字取自 Bernoulli(伯努利分布),TypeSafe CEO 在 Hacker News 上确认了这一点。
与 LLM 的分工
TypeSafe 给出的定位是,LLM 负责开放式推理和文本生成,Jev 负责流程中的快速结构化判断。官方博客用一个对比表概括两者的差异。
| 维度 | 前沿 LLM | Jev |
|---|---|---|
| 训练方法 | RLHF / RLVR | RLCD |
| 输出 | 字符串,需要解析校验 | 类型化结构值,无需解析 |
| 采样 | 逐 token 自回归 | 单次并行 |
| 输入价格 | $0.20 到 $10 / MTok | $0.042 / MTok |
| 输出价格 | 约为输入的 5 倍 | 免费 |
| 端到端延迟 | 3 秒到 329 秒 | 70ms 到 500ms |
团队与技术
TypeSafe AI 于 2024 年由 Diogo Almeida、Erik Gafni、Sasha Sheng 创立,总部旧金山,隐身开发约两年。Almeida 在 OpenAI 工作约 4 年,参与 RLHF、InstructGPT、ChatGPT 和 GPT-4 的研究,是 ChatGPT 背后指令跟随方法的构建者之一。他对 TechCrunch 表示,离开的原因是对话模型虽然强大,却对自动化无用,“我们优化的是人类语言,而计算机说另一种语言”。
技术层面公开信息有限:
- 架构,transformer,具体结构、权重和技术论文均未公布。外界观察者怀疑模型构建在某个 open-weight LLM 之上。
- 训练数据,全部为合成数据。Almeida 称这是他做过的最好的赌注之一,“比 RLHF 还好”。
- 训练方法,RLCD(Reinforcement Learning for Calibrated Decisions,校准决策强化学习),优化目标是概率与真实结果的校准程度,而非人类评分员的偏好。
- 采样方式,并行采样器一次生成全部输出,与逐 token 自回归生成相对。
模型命名来自 19 世纪英国经济学家 William Stanley Jevons。Jevons paradox 描述资源使用效率提升反而导致总消耗增加的现象,TypeSafe 期待机器智能走同样的路径,成本每降一个数量级就解锁数量级更多的用例。
性能与价格
官方给出的核心数字:
| 指标 | 数值 |
|---|---|
| 输入价格 | $0.042 / MTok(每十亿 token 42 美元) |
| 输出价格 | 免费 |
| 端到端延迟 | 70ms 到 500ms |
| 官方宣称 | 常规 40 到 200 倍快、40 到 400 倍便宜,峰值 193.6 倍快、444.6 倍便宜 |
作为参照,OpenAI GPT-5 Nano 的输入价格为 $0.05 / MTok,Jev 比它还低。
数字的口径
TypeSafe 在发布博客中标注了这些数字的边界:
- 193.6x 和 444.6x 来自 workflow evals,workflow 由公司 model capabilities 团队的成员设计,官方承认可能存在偏向自家模型的偏差。
- 参考答案取 GPT-6 Astra 和 Fable 5.1 的均值,官方承认这使答案偏向 OpenAI 和 Anthropic 的模型。
- 官方自评这些加速比“处于真实世界收益的高端”。
- 独立媒体 ts2.tech 的报道标题直接写明 445x 成本说法仍是 self-tested(自测),未有第三方复现。
官方另有两点可以较容易验证:延迟和价格本身透明,类型错误不存在有数学保证。
生态与采用
发布一周内的采用情况:
| 类型 | 项目 | 内容 |
|---|---|---|
| 平台集成 | Cloudflare Workers AI | models/typesafe/jev |
| 平台集成 | Vercel | 命令安全审查分类器 |
| 框架集成 | LangChain | langchain-typesafe 包 |
| 框架集成 | Pydantic | TypeSafeModel |
| 工具链 | Simon Willison | llm-typesafe 插件(LLM CLI) |
| 开源复刻 | Kev | 基于 Qwen 3.5 的 0.8B / 4B / 9B |
| 基准 | JevBench | 比较 Jev 类决策模型 |
实际案例有三个:
- Vercel,工程师 Pranit Sharma 称用 Jev 替换 ChatGPT Luna 5.6 做命令安全审查分类器,速度快 5 到 18 倍,准确率更高。
- Bryo AI,CTO Nikhil Mudholkar 测试 Jev 与 Gemini 分类商务邮件,Gemini 略准但贵 10 到 20 倍。他特别提到 Jev 返回的置信度是“唯一一个真实概率”,适合自动化工作流。
- LangChain 官方示例,model routing(按请求复杂度选模型)和 AutoModeMiddleware(工具调用风险门控),后者在 bash 执行前用 Jev 做风险分类。
社区玩法也已经出现,jevchat 让 Jev 逐符号生成聊天文本、jev-leftpad 用 Choice 问题实现 left-pad、jev-2048 让它玩 2048 游戏。发布一周内出现开源复刻和专属基准,说明开发者对这个方向的验证需求真实存在。
Earendil CTO Armin Ronacher 认为竞争对手会很快跟上,“LLM 太便宜太被补贴了,所以人们往往不需要发挥创造力”。
局限与争议
黑盒加深
这是 Simon Willison 在评测中提出的核心批评。LLM 至少可以给出解释,尽管解释本身不可靠;Jev 只返回一个浮点数,判断依据完全不可见。他明确反对用 Jev 给求职者排序,浮点数可能掩盖训练数据中的偏见。他做的湾区城市实验中,Jev 把 Cupertino 评为最好、East Palo Alto 排最末,结果可疑。
校准责任转移
Armin Ronacher 的表述是,Jev“把幻觉问题部分转移给了用户”。返回 50% 概率意味着调用方要自己决定是否采信,返回 95% 才可以行动。模型负责不确定性,代码负责业务政策,两者分离后阈值调整不依赖重新训练,但阈值定在哪里是人的责任。
官方承认的弱项
官方 jaggedness 文档标注 Jev 1.13 在以下方面表现较弱:
- 数字与日期处理
- adversarial content(对抗性内容)
- CJK(中日韩字符),官方文档明确其准确率显著低于英文
第三点与中文场景直接相关,中文业务接入前需要用自有数据验证。
可复现性为零
无技术论文、无公开架构、无第三方基准复现,核心性能数字全部来自厂商自测。厂商在博客中承认了评测偏差,但结论仍依赖自证。
判断框架
评估一个任务是否适合交给 Jev,三个问题:
- 任务能否表达成分类、打分或布尔判断,能表达就适合,需要开放生成则不适合。
- 概率输出的下游如何消费,调用方必须有明确的阈值策略,否则概率值无法转化为行动。
- 中文输入占比多少,CJK 弱项是官方标注的已知限制,中文为主的数据需要先跑评测。
信源
- TypeSafe AI 官方发布博客,https://typesafe.ai/blog/introducing-system-one-models-and-jev
- Wikipedia 词条 Jev (AI model),https://en.wikipedia.org/wiki/Jev_(AI_model)
- TechCrunch 报道(2026-09-18),https://techcrunch.com/2026/09/18/a-new-kind-of-ai-model-from-a-chatgpt-inventor-is-thrilling-developers/
- Simon Willison 评测(2026-09-21),https://simonwillison.net/2026/Sep/21/jev/
- LangChain 官方教程(2026-09-17),https://www.langchain.com/blog/building-a-harness-with-jev
- OSCHINA 报道,https://www.oschina.net/news/502609/typesafe-ai-system-one-models-and-jev
- Forbes 融资报道(2026-09-15),https://www.forbes.com/sites/the-prompt/2026/09/15/this-200-million-startup-wants-to-fix-ais-overconfidence-problem/
- ts2.tech 成本说法核查,https://ts2.tech/en/typesafe-ai-raises-40-million-for-jev-but-its-445x-cost-claim-is-still-self-tested/
作者: Cyber Herald
原文地址: https://torchtree.com/post/jev-decision-model/
发布时间: 2026-09-23
版权声明: CC BY-NC-SA 4.0