JEV 是 AI 智能体吗?走进 TypeSafe 的「System One」模型
给它一张工单,TypeSafe 的 Jev 不会写回复。它给出一个数字: 99.9% 的概率,这条消息很紧急。放弃生成文字、换来一个几毫秒内 可用的类型化答案——这就是「System One」模型的全部想法, 而它和 AI 智能体,是两回事。
Jev 不是 AI 智能体。它是一个「System One」判断模型:给它一份 固定的候选答案,它会在一次快速推理里给出其中一个,并附上 校准过的概率,然后就停在那里——没有对话,没有工具调用, 没有多步目标。TypeSafe 称它比同类判断快 40–200 倍、便宜最多 444.6 倍;独立测试证实了幅度更保守但依然可观的差距。实际 用法是把它塞进智能体的工作流里做路由和护栏层,而不是拿它 取代智能体本身。
Diogo Almeida 花了四年时间追问一个问题。在 OpenAI,他参与构建了 后来成为 ChatGPT 的指令遵循研究 [1] ——并眼看着语言模型在聊天上变得超乎常人,而企业真正想要的 「自动化」却依旧顽固地难以实现。2026 年 9 月 15 日,他的创业公司 TypeSafe AI 发布了他认为缺失的另一半:一个「System One」模型, 名字来自丹尼尔·卡尼曼笔下那种快速、直觉式的「系统 1」思维 [1]。 他们发布的第一个公开模型叫 Jev——得名于威廉·斯坦利·杰文斯, 押注的是「智能越便宜,需求只会越多,而不是越少」 [1]。
Jev 不生成文字。给它一个「状态」——一段话、一张工单、一个棋盘 局面——再加上一组类型化的问题,它会在一次并行推理里、而不是 一个词元接一个词元地,给出带校准概率的类型化答案 [1][2]。 TypeSafe 的文档定义了三种问题类型:Choice 从一份固定清单里选 (「这张工单该给哪个团队?」)、Score 在一个有序量表上打分 (「这位客户有多不满?」)、Noul 用一个概率回答是非题 (「这条消息是不是在要求退款?」) [2]。 每种答案的结构都是预先定好的——用 TypeSafe 自己的话说, 结果是「一次前沿智能的函数调用:输入非结构化的状态, 输出类型化的概率判断」 [1]。
一个拒绝写句子的模型,恰好就是一个路由决策所需要的一切。
被反复核实过的数字
TypeSafe 自己公布的对比里,Jev 的输入 token 定价是每百万 0.042 美元——十亿 token 42 美元——而它拿来对比的 LLM 是每百万 0.20 到 10 美元;因为没有文字要计费,Jev 的输出完全免费 [1]。 在速度上,它的工作流测评称响应时间为 70 到 500 毫秒, 而前沿 LLM 端到端要 3 到 329 秒;主页上「快 193.6 倍、 便宜 444.6 倍」这个数字,来自一次记录下来的运行:Jev 花费 0.000081 美元、用时 0.114 秒,对比模型花费 0.013880 美元、 用时 8.566 秒 [7]。 TypeSafe 自己也点出了其中的偏差——它用来对比的参考答案, 是两个 OpenAI 和 Anthropic 模型的平均值,官方也坦承这些 published 数字「处在真实收益的偏高一端」 [1]。
两份独立测试都在发布后一周内出炉,落点比官方数字保守得多。 liteLLM 的工程团队把 Jev 拿来当自家 AI 网关里的请求分类器, 对比 Claude Haiku 4.5:跑了 240 次调用,Jev 的中位分类耗时 126.81 毫秒,Haiku 是 688.40 毫秒——快 5.43 倍——按牌价算的 成本低 96.1%,而且在他们自己编写的路由标签上,Jev 命中率 95%,Haiku 是 73.75% [4]。 liteLLM 也主动说明了这个数字的天花板:标签是同一个团队自己 写的,没有经过独立评审,语料只有 80 条合成提示词,结果 「不能说明通用分类准确率,也不能说明最终答案的质量」 [4]。
第二份更简陋的测试来自一位独立开发者 Akshay Kanthed, 他写了个工具,专门扫描代码库里那些其实只是在做路由或分类的 LLM 调用,再对转换前后做基准测试 [5]。 针对真实的 OpenAI API,在三个真实测试用例上,一条手写的 本地规则在延迟上以 1,240 倍到 12,483 倍的优势打赢了 GPT-4o-mini 调用,成本几乎为零 [5]。 他明确说明这只是示意,而非定论:那条「本地规则」只是用来 代替 Jev、展示节省的大致形状,「不保证你自己的具体决策 也能一样干净地推广」 [5]。
它实际嵌在哪里
这一切都没有让 Jev 变成智能体的替代品——TypeSafe 没有这么 宣称,任何测试过它的人也没有。LangChain 自己的文章说得很直白: 「Jev 不是 LLM 的即插即用替代品……这让它成为驱动你智能体的 模型的一个理想搭档:用 LLM 做开放式的推理和生成, 用 Jev 沿途做快速的结构化判断」 [6]。 他们的集成提供了两种具体模式:一种是模型路由中间件, 让 Jev 在智能体开始之前,按每次请求挑一个便宜或强力的模型; 另一种是「自动模式」中间件,让 Jev 在一个有风险的工具调用—— 比如一条 bash 命令——被允许执行之前先做筛查 [6]。
同一周发布的一篇研究论文走得更远,把 System One 模型用作 整个智能体记忆系统的控制层,而不只是一次判断。Jev-Mem 把工作拆成两层:一层是快速的「System One」层,负责记忆的 分类、检索路由,以及何时停止检索;另一层是更慢的 「System Two」层——一个 LLM——只在最终的推理和作答阶段才被调用 [3]。 在 LoCoMo 基准上,这套拆分把记忆构建时间压到了 158 秒—— 比它对比过的最快系统还快 6.6 倍——平均查询延迟降到 0.93 秒, 降幅 36.7%,同时答案质量得分比最强的基线还高出 11.0% [3]。 三个例子里的规律都一样:Jev 坐在推理模型的前面或旁边, 负责决定接下来做什么。真正的推理,它不做。
「零幻觉」没说出来的那部分
TypeSafe 最大胆的说法,是 Jev 不会产生幻觉,而在一个很窄的 定义上,这是真的:因为每个答案都必须匹配预先声明好的结构, 类型错误是「数学上不可能」,而不是「经验上罕见」 [1]。 TypeSafe 自己的文档,对这份保证说得更谨慎:校准是「在一组 预测上衡量的,并不保证单条答案一定正确」 [2]。 一个自信、但答案值错了的类型化回答——形状对,值不对—— 仍然是可能的。Jev 消除的,是格式错误的响应把下游代码搞崩的 风险,而不是判断本身出错的风险。
所以——它算 AI 智能体吗
按本站的定义,不算。 AI 智能体 要在一连串动作里自己决定下一步;Jev 只回答一个类型化的问题, 然后就停下。它不会对话,不会自己调用工具,也不会跨多轮 追求一个目标。它是其他系统——包括智能体在内——需要一个快速、 便宜、结构化答案而不是一段文字时,可以调用的一个组件。 它是否比你智能体里现成的那个 LLM 更有用,取决于那个智能体 真正在做的事情里,有多少其实是「在一份短名单里做选择」—— 而根据上面那三份测试,这个比例可能比大多数团队测量过的 还要高。

资料来源
- TypeSafe AI — “Introducing System One Models & Jev”(官方博客,2026 年 9 月 15 日)
- TypeSafe AI — 文档:“System One”(docs.typesafe.ai/concepts/system-one)
- Jiang, Li & Li — “Jev-Mem: System-One-Controlled Agentic Memory for Efficient AI Agents”,arXiv:2609.23986(2026 年 9 月 21 日)
- liteLLM — “JEV Classifier: 5.43x as Fast as Haiku, 96% Lower Cost”(基准测试,2026 年 9 月 20 日)
- Akshay Kanthed,DEV Community — “I stopped believing '99% cost reduction' claims, so I benchmarked my own tool instead”(2026 年 9 月 21 日)
- LangChain — “Building a Harness with Jev”(2026 年 9 月 17 日)
- TypeSafe AI — 官网首页(typesafe.ai),工作流成本与延迟数据
常见问题
Jev 是 AI 智能体吗?
不是。Jev 是一个「System One」判断模型:它一次只回答一个类型化的问题——一个选择、一个打分,或一个是非判断——从一份固定的候选答案里给出一个,然后就停在那里。它不会对话,不会自己调用工具,也不会追求多步目标,而这正是本站对「智能体」的定义。它通常被当作智能体工作流里的一个组件来用,而不是智能体本身的替代品。
Jev 真的不会产生幻觉吗?
它保证不会给出超出预先声明结构的答案——TypeSafe 称这是数学上不可能,而不是经验上罕见。这和「答案正确」是两回事:TypeSafe 自己的文档写明,校准是「在一组预测上衡量的,并不保证单条答案一定正确」,一个自信但类型正确的答案,仍然可能是错的。
它比普通的 LLM 调用快多少、便宜多少?
TypeSafe 自己的工作流测评称,在这类任务上,同等智能水平下大约快 40–200 倍,成本最多低 444.6 倍。独立测试给出的幅度更保守,但依然可观:liteLLM 测得 Jev 的中位分类延迟比 Claude Haiku 4.5 快 5.43 倍,成本低约 96%,不过测试者也说明,这是一份仅 80 条提示词、由自己团队编写而非独立评审的窄范围测试。