如果你这几天刷 AI 新闻,一定看到了这个名字:Jev。
TypeSafe AI 在 9 月 15 日发布了它,然后整个圈子炸了——不是因为它又一个「超越 GPT」的 Benchmark 跑分,而是因为它从根本上重新定义了一个 AI 模型应该输出什么。
Jev 不能聊天。不能写代码。没有推理链。你给它一段客户投诉,问三个问题:这是紧急吗?该转哪个部门?客户情绪多差?它并行回答所有问题,70–500 毫秒内返回带概率的结构化结果,你的代码直接分支——不需要解析 JSON、不需要重试、不需要 Schema 验证。
这不是又一个更小更快的 GPT。Jev 的架构、训练目标、采样策略全部不同。TypeSafe 称之为 System One 模型,我认为这是 2026 年最有意思的 AI 发布之一。
这篇文章从架构原理、训练方法、实际能力到基础设施影响,帮你全面拆解。
1. 什么是 System One 模型
名字来自丹尼尔·卡尼曼的《思考,快与慢》:System 1 是快而直觉的,System 2 是慢而深思的。传统 LLM 是 System 2——逐 token 自回归生成文本。Jev 是 System 1——读一段状态(state),输出一个判断,单次并行前向传播完成。
| 维度 | LLM (System 2) | Jev (System One) |
|---|---|---|
| 训练信号 | RLHF — 优化人类偏好 | RLCD — 优化校准决策 |
| 输出 | 生成文本(字符串) | 带概率的 typed 结构化值 |
| 采样 | 顺序逐 token | 并行,所有输出一次完成 |
| 速度 | 3–329 秒(前沿模型) | 70–500 ms |
| 成本 | $0.20–$10 / M 输入 tokens,输出约 5x 更贵 | $0.042 / M 输入 tokens,输出免费 |
| 类型安全 | 需解析+验证,仍可能幻觉格式 | 数学上保证类型正确 |
| 置信度 | 过度自信且不一致 | 校准的:高置信度 = 高准确率 |
| 典型用例 | 聊天、代码生成、推理链 | 分类、路由、评分、验证 |
TypeSafe 在 workflow evals 上的数据是:比前沿 LLM 快 193.6 倍,便宜 444.6 倍。他们发布的 Pareto 图显示 Jev 在结构化决策任务上处于完全独立的曲线——任何价位的 LLM 都无法在速度+准确率组合上匹配。
2. 架构核心:并行采样
最根本的架构差异是并行采样。
传统 LLM 逐 token 生成:token N+1 依赖 token 0..N。要输出一个结构化决策(比如从 5 个选项中分类并给出概率),模型必须先产出一长串描述答案的 token——每一个 token 都是潜在的幻觉点。
Jev 反过来。给定一个 state 和一组 questions,它在单次前向传播中并行评估每个问题。输出是固定形状的 typed 结构:
- Noul:一个
[0, 1]浮点数,代表「是」的概率 - Choice:选中选项 + 所有选项的概率分布 + 置信度
- Score:概率加权得分 + 每级概率 + 置信度
因为输出形状在请求时就固定了,类型错误在数学上不可能发生。不存在幻觉出畸形 JSON 键或错误闭合括号的 token。
这对 agent 基础设施的意义巨大:你的代码不需要解析、验证、重试或 Schema 强制。response.answers["department"].choice 永远是 criteria 集合中的有效字符串。这是 AI 最接近「永远正确工作的函数调用」的一次。
3. RLCD:真正的训练秘密
TypeSafe 最重要的创新可能不是架构,而是 RLCD(Reinforcement Learning for Calibrated Decisions)。
每个主要 LLM 实验室都用某种 RLHF:训练一个基于人类偏好的奖励模型,然后最大化这个奖励。创始人 Diogo Almeida 说得直白:「生成人类标注者更喜欢的文本」对自动化来说是错误的优化目标。
RLVR(Reinforcement Learning with Verifiable Rewards)用程序化可验证的奖励信号部分解决了数学和代码的问题。但大多数现实世界的判断任务不适合这种形状——结果就是「尖峰智能」:在可验证 Benchmark 上表现好,在细微决策上不稳定。
RLCD 优化的是校准度(calibration):模型输出的概率应该匹配真实结果频率。当 Jev 说一个工单有 85% 概率属于「技术」类别时,在所有这样的判断中,大约 85% 应该确实是技术类。校准曲线(ECE、可靠性图)直接衡量这个指标,RLCD 直接优化它。
这和「让模型产出一条推理链然后希望结论正确」有本质区别。Jev 不推理——它判断。训练数据是 TypeSafe 自己合成的(他们自称为「主要是数据研究实验室」),RLCD 过程在 System One 任务上迭代改进校准度。
4. 三个原语:Noul, Choice, Score
TypeSafe 恰好暴露三种问题类型,每种对应一种基本的决策形状:
Noul(是否型)
最简单的原语。问一个二值问题,返回概率 [0, 1]。
用途:内容审核、护栏触发、相关性过滤、大规模二值分类。
Choice(N 选一)
从最多 255 个候选中选一个,返回完整概率分布 + 置信度。
{
"department": {
"type": "choice",
"choice": "technical",
"confidence": 0.78,
"probabilities": {
"technical": 0.85,
"sales": 0.0,
"billing": 0.15
}
}
}
用途:意图路由、工单分类、模型选择、链接选择(Wikiracing demo 每步从 ~100 个链接中选)。
Score(评分型)
在一组有序级别(2–10 级)上返回概率加权连续分数。
{
"frustration": {
"type": "score",
"score": 1.0,
"confidence": 1.0,
"probabilities": { "0": 0.0, "1": 1.0, "2": 0.0 }
}
}
用途:情感评分、质量评级、严重程度评估、复合评分(多个原子分数后在代码中组合)。
5. 置信度契约
Confidence 是 Jev 最被低估的杀手特性。
Choice 答案不仅返回选了什么,还返回模型对这个选择有多确定。置信度从概率分布计算:0.0(均匀分布——模型完全没把握)到 1.0(所有概率质量集中在一个选项)。
这开启了一种 TypeSafe 称为 confidence-gated routing 的模式:你的代码检查 if answer.confidence > 0.8: 自动处理; else: 升级到人类或昂贵 LLM。不需要 Prompt 工程。不需要「你确定吗?」重试。模型在不确定时就告诉你。
对 agent 基础设施来说,这是变革性的。当前的 agent 循环浪费大量计算在确定性的重试逻辑、确认 Prompt 和解析重试周期上。置信度门控架构在推理层面消除了大部分这种开销。
6. 两个 Demo:Doom 和 Wikiracing
Doom:10 次/秒的实时决策
Jev 通过评估游戏状态(敌人位置、血量、弹药、附近道具)来玩 Doom,以约 10 次查询/秒的速度选择动作。成本:约 $7/小时。模型不在像素上运行——游戏状态被预解析为结构化文本——但延迟预算符合实时游戏要求。
核心洞察:没有 LLM 能以商品化定价维持每秒 10 次结构化决策。这不仅是速度和成本问题,更是架构问题——Jev 的并行评估让它在同一前向传播中处理多个决策,而 LLM 必须为每个动作生成一串 token。
Wikiracing:无需解析的路由
从一篇 Wikipedia 文章出发,只用超链接导航到目标页面。每一步需要从数百个链接中选一个。Jev 评估每个链接的相关性并选一个。
关键洞察:Jev 永远不会幻觉出不存在的链接——这是 LLM 在高基数选择中常见的失败模式。利用 Choice 的 255 选项限制和更大候选集的 2 阶段评分,模型始终用更少的步数到达目标。
7. 已知缺陷:Jev 不能做什么
TypeSafe 发布了一份相当坦诚的 「jaggedness」文档。以下是真实限制:
-
字面阅读:Jev 回答你写的问题,不是你想问的。否定、隐含条件、作用域词都按字面理解。如果指令说「客户既生气又要求退款」而只有一个条件满足,Jev 可能基于部分重叠回答。规避:分解为独立问题。
-
不能数学和计数:Jev 不能可靠计数。在 8 个项目的列表中问「几个是水果」会失败。规避:每个项目一个 Noul,在代码中求和。
-
不能比较日期和时间:日期被视为文本,不是有序量。混合格式和时区边界特别不稳定。规避:用 Choice 提取组件,在代码中比较。TypeSafe 提供了一个日期提取 cookbook。
-
不支持间接推理:双重否定或属性之属性会降低准确率。规避:写最直接的问题。
-
对大状态敏感:准确率随着与决策无关的内容增多而下降。规避:代码中先检索和过滤相关字段。
-
不处理图像:目前仅文本输入。Doom demo 将游戏状态预解析为结构化文本。
-
语言偏差:英语是主要训练语言,准确率最好。中日韩及其他语言「效果不那么好」。
这些不是致命伤——它们是不同范式的边界。LLM 在这些方面也会失败,但失败的信号被流畅的文本掩盖了。Jev 的失败是透明的(低置信度、错误概率),因而更容易管理。
8. 对 Agent 基础设施的影响
对于正在构建 agent 基础设施的人(包括 MCPZERO 和 NanoRuntime 的我们),Jev 改变了几个关键子系统的计算:
路由层:不再用单个 LLM 调用来决定意图。部署 Jev 作为预路由器——70–500ms、$0.042/Mtok、零解析开销、置信度门控升级到更强模型。这是我所见过最干净的「分类器 → 专家」架构。
护栏:Jev 比现有护栏模型更快更便宜。每个检查一个 Noul 问题(检测到劫持?泄露了 PII?违反策略?)在同一调用中运行,增加可忽略的延迟。
验证:用 Jev 评分任何其他 LLM 的输出。「这个答案引用了证据吗?评分 0–2。」「这个推理链逻辑一致吗?Noul。」以生成式调用 1/400 的成本,你可以验证生产中的每个 LLM 输出。
Agent 行为 Map-Reduce:100 倍更便宜意味着你可以对 agent 会话的每一步进行分类、评分和特征提取——构建支持类似 ClawGuard 的可观测性和安全工具所需的行为数据集。
9. 更大的图景:Jevons Paradox
TypeSafe 将模型命名为 Jev 是为了纪念 William Stanley Jevons——他观察到煤的使用效率提高导致了更多的煤消费,而不是更少——因为更便宜的能源解锁了新用例。Jevons Paradox 是团队明确的赌注:当 AI 判断便宜 400 倍时,软件自动化的决策数量会爆发式增长,而不是收缩。
如果这个假设成立,未来不是一个巨大的聊天模型运行一切。它是一个分层架构:Jev 类模型在边缘做快速、廉价、校准的决策;更强的 LLM 保留给深度推理、创意生成和人类交互;中间的代码控制流程。
这是一个值得为之构建的未来。
关于作者:万戈(Chengqi),AI Infra 工程师,前华为/万翼,现构建 MCPZERO(Agent 工具协议)、ClawGuard(Agent 行为安全)和 NanoRuntime(轻量级 Agent Runtime)。