Recommended read. Jev gives up text generation to make AI dramatically faster. TypeSafe built a n...
TypeSafe开发的新架构Jev通过RLCD训练,使AI回答结构化问题速度提升40-200倍,且无需文本生成。
入选理由:Jev模型使用RLCD训练,提升响应速度40-200倍
不写文章,只做类型化判断的 AI 模型。
持续追踪 TypeSafe AI 的 Jev 决策模型:类型化选择、评分与概率判断,官方发布、API 与 SDK、Agent/浏览器集成、开源项目、评测和争议讨论。 这里把官方说明、社区实践和独立评测放在一起,注明每条结论的出处与适用范围。
快速认识
想理解 Jev 与普通大语言模型的边界,查看它的速度、成本、校准和已知失败模式,并追踪它在 Agent、浏览器自动化、模型路由和评测中的真实应用。
提交工单、页面 DOM、候选动作或其他经过筛选的文本状态。
Choice 选一个;Score 按标准打分;Noul 判断命题的成立倾向。
按概率、风险阈值与业务规则执行、回退或交给人工。
模型与价格是 2026-09-19 的官方文档快照,不是实时配置;项目数量是本站精选,不是全部生态规模。
事件脉络
时间线只反映 2026 年 9 月首周的关键节点,不把社区演示描述成已验证的通用能力。
TypeSafe AI 发布 Jev 与 System One 模型概念:以 state 和类型化问题替代开放式文本生成。发布帖中的加速倍数属于厂商口径。
发布原帖Vercel 的 fx 命令安全审查器测试 Jev;Guillermo Rauch 报告特定负载下 p95 最快提升 18 倍。不是通用基准。
Vercel CEO 原帖Browser Use 开源 jev-ultrafast,Jev 选动作,小型生成模型负责输入文字。机票任务的约 7 秒是作者在限定条件下的演示。
开源仓库Bespoke Nimble 等开放数据与模型的决策任务方案出现,证明这一产品形态可被复现,但不同任务集上还需公平对照。
Bespoke Nimble独立基准与逆向研究把讨论从“快多少倍”推进到分布外泛化、选项上限、confidence 含义和拒答能力。
Decision Model Benchmark核查笔记
以下梳理基于 TypeSafe 官方文档、社区项目目录、原始演示及独立评测的本地存档。性能数字按来源分别标注,不把厂商宣传、作者自报与受控实验混为一谈。
Jev 接收文本或结构化 state,对同一状态并行回答 Choice(选项)、Score(分档评分)和 Noul(真假倾向)问题;它不生成文章或聊天回复。
TypeSafe · Introduction官方文档列出 jev-1.13.0;jev-latest 是会移动的别名。2026-09-19 文档定价为每百万输入 token 0.042 美元、输出免费;上线前须复核当期价格。
TypeSafe · Models官方列明该版本对计数、日期比较、数值精度、长而杂的 state 和对抗性内容存在短板。适合把语义判断交给模型,把确定性计算留给代码。
TypeSafe · Jev 1.13 jaggednessBrowser Use 的 jev-ultrafast 用 Jev 选择浏览器动作,并在需要输入文本时回退到生成模型;演示中的耗时与成本属于项目作者自报。
browser-use/jev-ultrafast在内容生产侧,社区用多项 Score 判断社媒帖子、广告素材与编辑质量;这些是有用的工作流样本,不能直接当作准确率基准。
Made with Jev · Content & GrowthAwesome Jev 的 2026-09-19 快照收录 561 项,包含 SDK、Agent 工具、浏览器、游戏与评测;目录条目数不等于独立验证过的产品数。
Awesome Jev · 社区目录nibzard 的决策模型基准中,Jev 的 p50 约 264–276ms,和 Cerebras 上 gpt-oss-120b 的差距约 1.2 倍;其不确定性测试的校准误差为 ECE 0.246。加速倍数高度依赖所选基线。
nibzard · Decision Model Benchmark(v2 更正)AbdelStark 的小样本对照显示 Jev 在 AG News 和 Banking77 胜过 GLiNER2.5,但在 DAIR Emotion 差异不明显、校准较差。结果应按数据集解读。
AbdelStark · Jev Benchmarksbernoulli 的大规模 API 探测指出 Choice 的 confidence 与最高选项概率及选项个数有关;它不应被直接当成跨任务通用的正确概率。
bernoulli.app · Is Jev confident?外部逆向实验可观察到问题隔离、选项位置影响等行为,但不能据此确定底层是 MoE、扩散模型或某个参数规模;官方尚未公开完整架构。
Archer Hume · Jev's Architecture Unmaskedkev 用开源小模型复现类型化决策接口;其作者报告在训练同分布数据上接近 Jev,但分布外准确率 63.3% 对 Jev 的 82.3%。接口兼容不代表能力等价。
jaredpalmer/kev · 评测与模型卡Laya 提供本地运行与多语言实验,但模型卡也注明零样本效果和校准上的明显限制;做中文任务仍需自己的留出集验证。
NandhaKishorM/laya · BENCHMARKS专题阅读路线
交付包把三册组织成“会用 Jev → 理解设计 → 自己实现 System One Runtime”的连续路径。最终版 Word 与同步 Markdown 源稿已归档;交付清单统计合计 190,942 个净中文汉字、442 页。
这些是独立研究/教学书稿,不是 TypeSafe 官方文档;书中规格与案例以 2026-09-19 的资料为准,接入前仍需查阅官方原文。
用例索引
核对它实际负责哪一步,也看清仓库和演示不能证明什么。目录依据 2026-09-19 的本地资料整理。
SDK 接入
Vercel AI SDK可选的 TypeSafe provider 将 Choice、Score、Noul 映射为 evaluate 调用。
核查边界:不代表整个 AI SDK 默认使用 Jev。
浏览器 Agent
jev-ultrafast从 DOM 里的候选动作中选下一步,开放式文本仍交由生成模型。
核查边界:约 7 秒的机票演示是限定任务的作者报告,不是通用基准。
Agent 监督
foreman对任务完成、执行卡住和待验证状态并行作出判断。
核查边界:仓库可核对接入方式,不能据此推断监督准确率。
上下文管理
fast-jev-compaction判断工具调用和结果是否仍需保留,再由本地规则截短或删除。
核查边界:摘要可能丢失关键事实;演示耗时不能当在线 API 性能。
内容筛选
sift浏览器扩展把 X 帖子归类为信息、幽默、闲聊、推广等。
核查边界:展示了中文创作者可借鉴的工作流,不保证分类效果。
评测与工具链
WindTunnel组合 Jev、Mercury 与 WebMCP,公开浏览器任务的对照结果。
核查边界:组合方案完成 49/49 任务,不等于单独的 Jev 完成 49/49。
SDK 接入
TypeSafeClassifierLangChain 的可选适配器,把封闭选项和评分请求接入现有链路。
核查边界:仅说明存在 Jev 接入模块,不代表整个 LangChain 默认调用 Jev。
Agent 监督
agentgateway以类型化判断实现输入和输出内容的风险检查示例。
核查边界:示例阈值与错误策略需要按业务验证,不能替代确定性防护。
代码审查
Jev Review按风险、证据和严重程度组织代码审查中的窄问题。
核查边界:审查输出是线索,不是已被独立证实的缺陷。
内容筛选
zhihu-ai-filter浏览器扩展尝试为知乎信息流做内容分类与过滤。
核查边界:仓库存在不等于中文分类精度已被验证。
开源复现
kev开放模型与训练路径,提供兼容 System One 的接口和对照评测。
核查边界:同分布数据接近 Jev,分布外准确率存在明显差距。
开源复现
Laya探索本地和多语言的类型化决策,公开模型卡与基准。
核查边界:零样本表现与校准有限,中文使用应自行评测。
开源复现
NanoJev以 Qwen3-0.6B 和专用决策头实现并行决策,公开模型、数据和训练流程。
核查边界:项目展示的是其自测任务;游戏成绩不能推广为开放域语义准确率。
开源复现
SemIf用开放语言模型直接计算选项概率,探索共享状态和低延迟服务。
核查边界:实现路线不同于原生决策头,也不代表复刻了 Jev 未公开的模型结构。
开源复现
openjev-sglang基于 SGLang 为开放模型提供 Jev 兼容的 prefill-only 决策端点。
核查边界:接口兼容与 serving 优化不等于相同的模型质量或概率校准。
配套开源实验 / 非官方实现
分享对话描述了两条模型路径:训练原生决策模型,或从开放语言模型读取选项概率。它们共用概率、校准、策略和慢路径回退层;这属于独立实验,不是 TypeSafe 官方 Jev 的内部实现。
为什么分布外测试更关键
分享对话称:合成数据 480 条训练、120 条验证,IID 准确率 100%;16 条人工改写的 OOD 样本准确率 62.5%。
源码、数据及 checkpoint 已归档至 openjev;上述成绩来自交付文件,本站未独立复跑。小样本、合成同分布结果不能证明开放域能力,也不是对官方 Jev 的公平基准。
研究视角
数字只有连同来源、基线和适用任务一起看才有意义。厂商报价、独立实验和社区数量按不同口径展示。
输出免费;别名 jev-latest 当时指向 jev-1.13.0。价格和模型映射会变动。
官方文档 · 2026-09-19 快照同一基准对 Cerebras gpt-oss-120b 只快约 1.2 倍;不能把厂商的 20–200 倍外推到所有比较。
nibzard 独立基准 · v2该任务中 Jev 承认不确定的比例约 49.7%;confidence 阈值不能未经校准就跨任务复用。
nibzard 独立基准 · 强制不确定题开源 kev 对照官方 Jev 的准确率;同分布时差距很小,换任务后拉开。两者不是同一模型。
kev 作者自测 · 分布外对照目录包含 SDK、Demo、文章及评测,不代表 561 个已验证的产品,更不等于真实生产采用。
Awesome Jev · 2026-09-19 社区快照接入前必读
按 Jev 1.13 官方文档整理。尤其要在中文内容与自己的业务数据上重新测准确率和阈值。
会照字面回答,而非揣测意图。
建议:写明条件、否定和边界情形。
不擅长精确计算、计数和比较数值。
建议:让代码完成可精确计算的部分。
把日期当文本,不可靠地判断先后。
建议:模型提取日期组件,代码负责排序和运算。
双重否定与多跳问题更容易出错。
建议:拆成直接、原子化的问题。
无关 state 会稀释与问题相关的信息。
建议:先检索和过滤,再提交必要字段。
输入中的诱导指令可能改变答案。
建议:把外部内容视作数据并做针对性回归测试。
instructions 与 criteria 不一致时容易混淆。
建议:让二者同向描述判断标准。
Noul 与 Choice 的数值不能互换;正反问题也未必互补。
建议:各原语单独校准,不跨形式套阈值。
不能胜任文章或对话生成。
建议:让 Jev 选择或评分,由生成模型写文字。
从原文开始
官方信息、独立实验与社区目录分开阅读。项目数、点赞数和价格都有时间边界;统计口径不同的目录不能相加。
采集边界:本地资料存档了官方文档、社区目录、X 原帖、HN 讨论和独立评测;X 搜索与互动数并非完整、实时或穷举。模型架构、参数量和训练配方未获官方完整公开,不把逆向推断写成事实。
来自 traeai
下方文章按站内采集持续更新,与上方截至 2026-09-19 的研究快照分开维护。
TypeSafe开发的新架构Jev通过RLCD训练,使AI回答结构化问题速度提升40-200倍,且无需文本生成。
入选理由:Jev模型使用RLCD训练,提升响应速度40-200倍