<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
    <channel>
        <title>决策模型 on 火炬树</title>
        <link>https://torchtree.com/tags/%E5%86%B3%E7%AD%96%E6%A8%A1%E5%9E%8B/</link>
        <description>Recent content in 决策模型 on 火炬树</description>
        <generator>Hugo -- gohugo.io</generator>
        <language>zh-cn</language>
        <copyright>TorchTree Co., Ltd.</copyright>
        <lastBuildDate>Wed, 23 Sep 2026 10:30:00 +0800</lastBuildDate><atom:link href="https://torchtree.com/tags/%E5%86%B3%E7%AD%96%E6%A8%A1%E5%9E%8B/index.xml" rel="self" type="application/rss+xml" /><item>
        <title>决策模型 Jev 究竟是做什么的？</title>
        <link>https://torchtree.com/post/jev-decision-model/</link>
        <pubDate>Wed, 23 Sep 2026 10:30:00 +0800</pubDate>
        
        <guid>https://torchtree.com/post/jev-decision-model/</guid>
        <description>&lt;p&gt;2026 年 9 月 15 日，TypeSafe AI 发布 Jev，一个不生成任何自然语言文本的模型。它接收一段状态和几个预定义问题，返回带概率的类型化答案，供程序直接消费。发布同日公司宣布 4000 万美元种子轮融资，一周内 API 因请求量过大短暂宕机，Cloudflare、Vercel、LangChain、Pydantic 相继接入。&lt;/p&gt;
&lt;p&gt;本文按是什么、团队与技术、性能与价格、生态与采用、局限与争议五部分梳理这个新品类。&lt;/p&gt;
&lt;h2 id=&#34;jev-是什么&#34;&gt;Jev 是什么
&lt;/h2&gt;&lt;p&gt;Jev 是 TypeSafe AI 开发的专有模型，当前版本 jev-1.13.0，以 early access 形式开放。它属于 TypeSafe 定义的新类别 System One model，命名取自卡尼曼《思考，快与慢》中快速直觉的 System 1。Simon Willison 和 Maggie Appleton 等人认为 decision model（决策模型）是更准确的名字。&lt;/p&gt;
&lt;p&gt;一次 Jev 请求包含两部分：&lt;/p&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th&gt;组成&lt;/th&gt;
          &lt;th&gt;内容&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td&gt;state&lt;/td&gt;
          &lt;td&gt;字符串、JSON 对象或文本数组，描述当前状态&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;questions&lt;/td&gt;
          &lt;td&gt;一个或多个带类型的问题&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;模型在一次并行计算中评估全部问题，所有问题共用同一个 state，返回的答案结构在请求时已经定义完成。答案附带概率分布和置信度，模型无法返回定义之外的值。TypeSafe 据此宣称幻觉和类型错误在 Jev 上不存在，类型错误在数学上不可能出现。&lt;/p&gt;
&lt;h3 id=&#34;三种问题原语&#34;&gt;三种问题原语
&lt;/h3&gt;&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th&gt;原语&lt;/th&gt;
          &lt;th&gt;用途&lt;/th&gt;
          &lt;th&gt;返回&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td&gt;Choice&lt;/td&gt;
          &lt;td&gt;从给定选项中选一&lt;/td&gt;
          &lt;td&gt;选中项、每项概率、置信度&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;Score&lt;/td&gt;
          &lt;td&gt;按有序等级打分&lt;/td&gt;
          &lt;td&gt;分数、等级分布、置信度&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;Noul&lt;/td&gt;
          &lt;td&gt;判断陈述真伪&lt;/td&gt;
          &lt;td&gt;0 到 1 的概率&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;Noul 这个名字取自 Bernoulli（伯努利分布），TypeSafe CEO 在 Hacker News 上确认了这一点。&lt;/p&gt;
&lt;h3 id=&#34;与-llm-的分工&#34;&gt;与 LLM 的分工
&lt;/h3&gt;&lt;p&gt;TypeSafe 给出的定位是，LLM 负责开放式推理和文本生成，Jev 负责流程中的快速结构化判断。官方博客用一个对比表概括两者的差异。&lt;/p&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th&gt;维度&lt;/th&gt;
          &lt;th&gt;前沿 LLM&lt;/th&gt;
          &lt;th&gt;Jev&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td&gt;训练方法&lt;/td&gt;
          &lt;td&gt;RLHF / RLVR&lt;/td&gt;
          &lt;td&gt;RLCD&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;输出&lt;/td&gt;
          &lt;td&gt;字符串，需要解析校验&lt;/td&gt;
          &lt;td&gt;类型化结构值，无需解析&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;采样&lt;/td&gt;
          &lt;td&gt;逐 token 自回归&lt;/td&gt;
          &lt;td&gt;单次并行&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;输入价格&lt;/td&gt;
          &lt;td&gt;$0.20 到 $10 / MTok&lt;/td&gt;
          &lt;td&gt;$0.042 / MTok&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;输出价格&lt;/td&gt;
          &lt;td&gt;约为输入的 5 倍&lt;/td&gt;
          &lt;td&gt;免费&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;端到端延迟&lt;/td&gt;
          &lt;td&gt;3 秒到 329 秒&lt;/td&gt;
          &lt;td&gt;70ms 到 500ms&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;h2 id=&#34;团队与技术&#34;&gt;团队与技术
&lt;/h2&gt;&lt;p&gt;TypeSafe AI 于 2024 年由 Diogo Almeida、Erik Gafni、Sasha Sheng 创立，总部旧金山，隐身开发约两年。Almeida 在 OpenAI 工作约 4 年，参与 RLHF、InstructGPT、ChatGPT 和 GPT-4 的研究，是 ChatGPT 背后指令跟随方法的构建者之一。他对 TechCrunch 表示，离开的原因是对话模型虽然强大，却对自动化无用，“我们优化的是人类语言，而计算机说另一种语言”。&lt;/p&gt;
&lt;p&gt;技术层面公开信息有限：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;架构&lt;/strong&gt;，transformer，具体结构、权重和技术论文均未公布。外界观察者怀疑模型构建在某个 open-weight LLM 之上。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;训练数据&lt;/strong&gt;，全部为合成数据。Almeida 称这是他做过的最好的赌注之一，“比 RLHF 还好”。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;训练方法&lt;/strong&gt;，RLCD（Reinforcement Learning for Calibrated Decisions，校准决策强化学习），优化目标是概率与真实结果的校准程度，而非人类评分员的偏好。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;采样方式&lt;/strong&gt;，并行采样器一次生成全部输出，与逐 token 自回归生成相对。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;模型命名来自 19 世纪英国经济学家 William Stanley Jevons。Jevons paradox 描述资源使用效率提升反而导致总消耗增加的现象，TypeSafe 期待机器智能走同样的路径，成本每降一个数量级就解锁数量级更多的用例。&lt;/p&gt;
&lt;h2 id=&#34;性能与价格&#34;&gt;性能与价格
&lt;/h2&gt;&lt;p&gt;官方给出的核心数字：&lt;/p&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th&gt;指标&lt;/th&gt;
          &lt;th&gt;数值&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td&gt;输入价格&lt;/td&gt;
          &lt;td&gt;$0.042 / MTok（每十亿 token 42 美元）&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;输出价格&lt;/td&gt;
          &lt;td&gt;免费&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;端到端延迟&lt;/td&gt;
          &lt;td&gt;70ms 到 500ms&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;官方宣称&lt;/td&gt;
          &lt;td&gt;常规 40 到 200 倍快、40 到 400 倍便宜，峰值 193.6 倍快、444.6 倍便宜&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;作为参照，OpenAI GPT-5 Nano 的输入价格为 $0.05 / MTok，Jev 比它还低。&lt;/p&gt;
&lt;h3 id=&#34;数字的口径&#34;&gt;数字的口径
&lt;/h3&gt;&lt;p&gt;TypeSafe 在发布博客中标注了这些数字的边界：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;193.6x 和 444.6x 来自 workflow evals，workflow 由公司 model capabilities 团队的成员设计，官方承认可能存在偏向自家模型的偏差。&lt;/li&gt;
&lt;li&gt;参考答案取 GPT-6 Astra 和 Fable 5.1 的均值，官方承认这使答案偏向 OpenAI 和 Anthropic 的模型。&lt;/li&gt;
&lt;li&gt;官方自评这些加速比“处于真实世界收益的高端”。&lt;/li&gt;
&lt;li&gt;独立媒体 ts2.tech 的报道标题直接写明 445x 成本说法仍是 self-tested（自测），未有第三方复现。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;官方另有两点可以较容易验证：延迟和价格本身透明，类型错误不存在有数学保证。&lt;/p&gt;
&lt;h2 id=&#34;生态与采用&#34;&gt;生态与采用
&lt;/h2&gt;&lt;p&gt;发布一周内的采用情况：&lt;/p&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th&gt;类型&lt;/th&gt;
          &lt;th&gt;项目&lt;/th&gt;
          &lt;th&gt;内容&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td&gt;平台集成&lt;/td&gt;
          &lt;td&gt;Cloudflare Workers AI&lt;/td&gt;
          &lt;td&gt;models/typesafe/jev&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;平台集成&lt;/td&gt;
          &lt;td&gt;Vercel&lt;/td&gt;
          &lt;td&gt;命令安全审查分类器&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;框架集成&lt;/td&gt;
          &lt;td&gt;LangChain&lt;/td&gt;
          &lt;td&gt;langchain-typesafe 包&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;框架集成&lt;/td&gt;
          &lt;td&gt;Pydantic&lt;/td&gt;
          &lt;td&gt;TypeSafeModel&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;工具链&lt;/td&gt;
          &lt;td&gt;Simon Willison&lt;/td&gt;
          &lt;td&gt;llm-typesafe 插件（LLM CLI）&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;开源复刻&lt;/td&gt;
          &lt;td&gt;Kev&lt;/td&gt;
          &lt;td&gt;基于 Qwen 3.5 的 0.8B / 4B / 9B&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;基准&lt;/td&gt;
          &lt;td&gt;JevBench&lt;/td&gt;
          &lt;td&gt;比较 Jev 类决策模型&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;实际案例有三个：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Vercel&lt;/strong&gt;，工程师 Pranit Sharma 称用 Jev 替换 ChatGPT Luna 5.6 做命令安全审查分类器，速度快 5 到 18 倍，准确率更高。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Bryo AI&lt;/strong&gt;，CTO Nikhil Mudholkar 测试 Jev 与 Gemini 分类商务邮件，Gemini 略准但贵 10 到 20 倍。他特别提到 Jev 返回的置信度是“唯一一个真实概率”，适合自动化工作流。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;LangChain 官方示例&lt;/strong&gt;，model routing（按请求复杂度选模型）和 AutoModeMiddleware（工具调用风险门控），后者在 bash 执行前用 Jev 做风险分类。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;社区玩法也已经出现，jevchat 让 Jev 逐符号生成聊天文本、jev-leftpad 用 Choice 问题实现 left-pad、jev-2048 让它玩 2048 游戏。发布一周内出现开源复刻和专属基准，说明开发者对这个方向的验证需求真实存在。&lt;/p&gt;
&lt;p&gt;Earendil CTO Armin Ronacher 认为竞争对手会很快跟上，“LLM 太便宜太被补贴了，所以人们往往不需要发挥创造力”。&lt;/p&gt;
&lt;h2 id=&#34;局限与争议&#34;&gt;局限与争议
&lt;/h2&gt;&lt;h3 id=&#34;黑盒加深&#34;&gt;黑盒加深
&lt;/h3&gt;&lt;p&gt;这是 Simon Willison 在评测中提出的核心批评。LLM 至少可以给出解释，尽管解释本身不可靠；Jev 只返回一个浮点数，判断依据完全不可见。他明确反对用 Jev 给求职者排序，浮点数可能掩盖训练数据中的偏见。他做的湾区城市实验中，Jev 把 Cupertino 评为最好、East Palo Alto 排最末，结果可疑。&lt;/p&gt;
&lt;h3 id=&#34;校准责任转移&#34;&gt;校准责任转移
&lt;/h3&gt;&lt;p&gt;Armin Ronacher 的表述是，Jev“把幻觉问题部分转移给了用户”。返回 50% 概率意味着调用方要自己决定是否采信，返回 95% 才可以行动。模型负责不确定性，代码负责业务政策，两者分离后阈值调整不依赖重新训练，但阈值定在哪里是人的责任。&lt;/p&gt;
&lt;h3 id=&#34;官方承认的弱项&#34;&gt;官方承认的弱项
&lt;/h3&gt;&lt;p&gt;官方 jaggedness 文档标注 Jev 1.13 在以下方面表现较弱：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;数字与日期处理&lt;/li&gt;
&lt;li&gt;adversarial content（对抗性内容）&lt;/li&gt;
&lt;li&gt;CJK（中日韩字符），官方文档明确其准确率显著低于英文&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;第三点与中文场景直接相关，中文业务接入前需要用自有数据验证。&lt;/p&gt;
&lt;h3 id=&#34;可复现性为零&#34;&gt;可复现性为零
&lt;/h3&gt;&lt;p&gt;无技术论文、无公开架构、无第三方基准复现，核心性能数字全部来自厂商自测。厂商在博客中承认了评测偏差，但结论仍依赖自证。&lt;/p&gt;
&lt;h2 id=&#34;判断框架&#34;&gt;判断框架
&lt;/h2&gt;&lt;p&gt;评估一个任务是否适合交给 Jev，三个问题：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;任务能否表达成分类、打分或布尔判断&lt;/strong&gt;，能表达就适合，需要开放生成则不适合。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;概率输出的下游如何消费&lt;/strong&gt;，调用方必须有明确的阈值策略，否则概率值无法转化为行动。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;中文输入占比多少&lt;/strong&gt;，CJK 弱项是官方标注的已知限制，中文为主的数据需要先跑评测。&lt;/li&gt;
&lt;/ol&gt;
&lt;h2 id=&#34;信源&#34;&gt;信源
&lt;/h2&gt;&lt;ul&gt;
&lt;li&gt;TypeSafe AI 官方发布博客，&lt;a class=&#34;link&#34; href=&#34;https://typesafe.ai/blog/introducing-system-one-models-and-jev&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;https://typesafe.ai/blog/introducing-system-one-models-and-jev&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;Wikipedia 词条 Jev (AI model)，&lt;a class=&#34;link&#34; href=&#34;https://en.wikipedia.org/wiki/Jev_%28AI_model%29&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;https://en.wikipedia.org/wiki/Jev_(AI_model)&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;TechCrunch 报道（2026-09-18），&lt;a class=&#34;link&#34; href=&#34;https://techcrunch.com/2026/09/18/a-new-kind-of-ai-model-from-a-chatgpt-inventor-is-thrilling-developers/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;https://techcrunch.com/2026/09/18/a-new-kind-of-ai-model-from-a-chatgpt-inventor-is-thrilling-developers/&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;Simon Willison 评测（2026-09-21），&lt;a class=&#34;link&#34; href=&#34;https://simonwillison.net/2026/Sep/21/jev/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;https://simonwillison.net/2026/Sep/21/jev/&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;LangChain 官方教程（2026-09-17），&lt;a class=&#34;link&#34; href=&#34;https://www.langchain.com/blog/building-a-harness-with-jev&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;https://www.langchain.com/blog/building-a-harness-with-jev&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;OSCHINA 报道，&lt;a class=&#34;link&#34; href=&#34;https://www.oschina.net/news/502609/typesafe-ai-system-one-models-and-jev&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;https://www.oschina.net/news/502609/typesafe-ai-system-one-models-and-jev&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;Forbes 融资报道（2026-09-15），&lt;a class=&#34;link&#34; href=&#34;https://www.forbes.com/sites/the-prompt/2026/09/15/this-200-million-startup-wants-to-fix-ais-overconfidence-problem/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;https://www.forbes.com/sites/the-prompt/2026/09/15/this-200-million-startup-wants-to-fix-ais-overconfidence-problem/&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;ts2.tech 成本说法核查，&lt;a class=&#34;link&#34; href=&#34;https://ts2.tech/en/typesafe-ai-raises-40-million-for-jev-but-its-445x-cost-claim-is-still-self-tested/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;https://ts2.tech/en/typesafe-ai-raises-40-million-for-jev-but-its-445x-cost-claim-is-still-self-tested/&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
</description>
        </item>
        
    </channel>
</rss>
