T
traeai
登录
决策模型观察/TypeSafe AI · System One

Jev

不写文章,只做类型化判断的 AI 模型。

持续追踪 TypeSafe AI 的 Jev 决策模型:类型化选择、评分与概率判断,官方发布、API 与 SDK、Agent/浏览器集成、开源项目、评测和争议讨论。 这里把官方说明、社区实践和独立评测放在一起,注明每条结论的出处与适用范围。

资料核对 独立整理 · 非 TypeSafe 官方站点官方快速上手

快速认识

把判断交给模型,把执行留给代码

官方定义

想理解 Jev 与普通大语言模型的边界,查看它的速度、成本、校准和已知失败模式,并追踪它在 Agent、浏览器自动化、模型路由和评测中的真实应用。

1 / 输入 state

提交工单、页面 DOM、候选动作或其他经过筛选的文本状态。

2 / 提问

Choice 选一个;Score 按标准打分;Noul 判断命题的成立倾向。

3 / 代码处置

按概率、风险阈值与业务规则执行、回退或交给人工。

模型快照
jev-1.13.0
输入价格
$0.042 / MTok
研究主题
4 组
精选项目
15 项

模型与价格是 2026-09-19 的官方文档快照,不是实时配置;项目数量是本站精选,不是全部生态规模。

事件脉络

从发布到外部验证

时间线只反映 2026 年 9 月首周的关键节点,不把社区演示描述成已验证的通用能力。

  1. 2026.09.15

    官方发布

    TypeSafe AI 发布 Jev 与 System One 模型概念:以 state 和类型化问题替代开放式文本生成。发布帖中的加速倍数属于厂商口径。

    发布原帖
  2. 2026.09.16

    生产侧反馈

    Vercel 的 fx 命令安全审查器测试 Jev;Guillermo Rauch 报告特定负载下 p95 最快提升 18 倍。不是通用基准。

    Vercel CEO 原帖
  3. 2026.09.17

    浏览器场景扩散

    Browser Use 开源 jev-ultrafast,Jev 选动作,小型生成模型负责输入文字。机票任务的约 7 秒是作者在限定条件下的演示。

    开源仓库
  4. 2026.09.18

    开源方案跟进

    Bespoke Nimble 等开放数据与模型的决策任务方案出现,证明这一产品形态可被复现,但不同任务集上还需公平对照。

    Bespoke Nimble
  5. 2026.09.19

    评测聚焦校准

    独立基准与逆向研究把讨论从“快多少倍”推进到分布外泛化、选项上限、confidence 含义和拒答能力。

    Decision Model Benchmark

核查笔记

专题档案

以下梳理基于 TypeSafe 官方文档、社区项目目录、原始演示及独立评测的本地存档。性能数字按来源分别标注,不把厂商宣传、作者自报与受控实验混为一谈。

模型与接入

  • Jev 接收文本或结构化 state,对同一状态并行回答 Choice(选项)、Score(分档评分)和 Noul(真假倾向)问题;它不生成文章或聊天回复。

    TypeSafe · Introduction
  • 官方文档列出 jev-1.13.0;jev-latest 是会移动的别名。2026-09-19 文档定价为每百万输入 token 0.042 美元、输出免费;上线前须复核当期价格。

    TypeSafe · Models
  • 官方列明该版本对计数、日期比较、数值精度、长而杂的 state 和对抗性内容存在短板。适合把语义判断交给模型,把确定性计算留给代码。

    TypeSafe · Jev 1.13 jaggedness

项目与使用场景

  • Browser Use 的 jev-ultrafast 用 Jev 选择浏览器动作,并在需要输入文本时回退到生成模型;演示中的耗时与成本属于项目作者自报。

    browser-use/jev-ultrafast
  • 在内容生产侧,社区用多项 Score 判断社媒帖子、广告素材与编辑质量;这些是有用的工作流样本,不能直接当作准确率基准。

    Made with Jev · Content & Growth
  • Awesome Jev 的 2026-09-19 快照收录 561 项,包含 SDK、Agent 工具、浏览器、游戏与评测;目录条目数不等于独立验证过的产品数。

    Awesome Jev · 社区目录

独立评测与争议

  • nibzard 的决策模型基准中,Jev 的 p50 约 264–276ms,和 Cerebras 上 gpt-oss-120b 的差距约 1.2 倍;其不确定性测试的校准误差为 ECE 0.246。加速倍数高度依赖所选基线。

    nibzard · Decision Model Benchmark(v2 更正)
  • AbdelStark 的小样本对照显示 Jev 在 AG News 和 Banking77 胜过 GLiNER2.5,但在 DAIR Emotion 差异不明显、校准较差。结果应按数据集解读。

    AbdelStark · Jev Benchmarks
  • bernoulli 的大规模 API 探测指出 Choice 的 confidence 与最高选项概率及选项个数有关;它不应被直接当成跨任务通用的正确概率。

    bernoulli.app · Is Jev confident?
  • 外部逆向实验可观察到问题隔离、选项位置影响等行为,但不能据此确定底层是 MoE、扩散模型或某个参数规模;官方尚未公开完整架构。

    Archer Hume · Jev's Architecture Unmasked

开源复现与替代

  • kev 用开源小模型复现类型化决策接口;其作者报告在训练同分布数据上接近 Jev,但分布外准确率 63.3% 对 Jev 的 82.3%。接口兼容不代表能力等价。

    jaredpalmer/kev · 评测与模型卡
  • Laya 提供本地运行与多语言实验,但模型卡也注明零样本效果和校准上的明显限制;做中文任务仍需自己的留出集验证。

    NandhaKishorM/laya · BENCHMARKS

专题阅读路线

三册 Jev 技术书

查看分享对话

交付包把三册组织成“会用 Jev → 理解设计 → 自己实现 System One Runtime”的连续路径。最终版 Word 与同步 Markdown 源稿已归档;交付清单统计合计 190,942 个净中文汉字、442 页。

  1. 01

    Jev 使用文档

    从第一次调用到生产工作流

    API 与 SDK、Choice / Noul / Score、概率与 confidence、并行问题和错误处理。

    读完可做:能设计窄问题,并在业务代码里设置阈值与人工回退。

  2. 02

    深入理解 Jev

    从 System One 到概率决策

    决策契约、校准、失败模式、Fast / Slow Runtime,以及不同开源方案的模型与 serving 路线。

    读完可做:能判断何时该用专门的决策模型,何时仍需生成模型和确定性代码。

  3. 03

    动手做一个 Jev

    从 MiniJev 到开源 JevLab

    实现原语与概率层、训练原生决策模型、选项打分后端、HTTP Runtime 和分布外评测。

    读完可做:能搭建实验骨架,并用留出数据检验泛化,而非只看接口是否兼容。

这些是独立研究/教学书稿,不是 TypeSafe 官方文档;书中规格与案例以 2026-09-19 的资料为准,接入前仍需查阅官方原文。

用例索引

精选项目索引

核对它实际负责哪一步,也看清仓库和演示不能证明什么。目录依据 2026-09-19 的本地资料整理。

显示 15 / 15
  • SDK 接入

    Vercel AI SDK

    可选的 TypeSafe provider 将 Choice、Score、Noul 映射为 evaluate 调用。

    核查边界:不代表整个 AI SDK 默认使用 Jev。

  • 浏览器 Agent

    jev-ultrafast

    从 DOM 里的候选动作中选下一步,开放式文本仍交由生成模型。

    核查边界:约 7 秒的机票演示是限定任务的作者报告,不是通用基准。

  • Agent 监督

    foreman

    对任务完成、执行卡住和待验证状态并行作出判断。

    核查边界:仓库可核对接入方式,不能据此推断监督准确率。

  • 上下文管理

    fast-jev-compaction

    判断工具调用和结果是否仍需保留,再由本地规则截短或删除。

    核查边界:摘要可能丢失关键事实;演示耗时不能当在线 API 性能。

  • 内容筛选

    sift

    浏览器扩展把 X 帖子归类为信息、幽默、闲聊、推广等。

    核查边界:展示了中文创作者可借鉴的工作流,不保证分类效果。

  • 评测与工具链

    WindTunnel

    组合 Jev、Mercury 与 WebMCP,公开浏览器任务的对照结果。

    核查边界:组合方案完成 49/49 任务,不等于单独的 Jev 完成 49/49。

  • SDK 接入

    TypeSafeClassifier

    LangChain 的可选适配器,把封闭选项和评分请求接入现有链路。

    核查边界:仅说明存在 Jev 接入模块,不代表整个 LangChain 默认调用 Jev。

  • Agent 监督

    agentgateway

    以类型化判断实现输入和输出内容的风险检查示例。

    核查边界:示例阈值与错误策略需要按业务验证,不能替代确定性防护。

  • 代码审查

    Jev Review

    按风险、证据和严重程度组织代码审查中的窄问题。

    核查边界:审查输出是线索,不是已被独立证实的缺陷。

  • 内容筛选

    zhihu-ai-filter

    浏览器扩展尝试为知乎信息流做内容分类与过滤。

    核查边界:仓库存在不等于中文分类精度已被验证。

  • 开源复现

    kev

    开放模型与训练路径,提供兼容 System One 的接口和对照评测。

    核查边界:同分布数据接近 Jev,分布外准确率存在明显差距。

  • 开源复现

    Laya

    探索本地和多语言的类型化决策,公开模型卡与基准。

    核查边界:零样本表现与校准有限,中文使用应自行评测。

  • 开源复现

    NanoJev

    以 Qwen3-0.6B 和专用决策头实现并行决策,公开模型、数据和训练流程。

    核查边界:项目展示的是其自测任务;游戏成绩不能推广为开放域语义准确率。

  • 开源复现

    SemIf

    用开放语言模型直接计算选项概率,探索共享状态和低延迟服务。

    核查边界:实现路线不同于原生决策头,也不代表复刻了 Jev 未公开的模型结构。

  • 开源复现

    openjev-sglang

    基于 SGLang 为开放模型提供 Jev 兼容的 prefill-only 决策端点。

    核查边界:接口兼容与 serving 优化不等于相同的模型质量或概率校准。

配套开源实验 / 非官方实现

JevLab:从接口到可评测的决策 Runtime

分享对话描述了两条模型路径:训练原生决策模型,或从开放语言模型读取选项概率。它们共用概率、校准、策略和慢路径回退层;这属于独立实验,不是 TypeSafe 官方 Jev 的内部实现。

  1. 01Native 决策模型 / 开放模型选项打分
  2. 02概率分布与校准
  3. 03Confidence Gate 与策略
  4. 04Decision Graph 与慢路径回退

为什么分布外测试更关键

分享对话称:合成数据 480 条训练、120 条验证,IID 准确率 100%;16 条人工改写的 OOD 样本准确率 62.5%。

源码、数据及 checkpoint 已归档至 openjev;上述成绩来自交付文件,本站未独立复跑。小样本、合成同分布结果不能证明开放域能力,也不是对官方 Jev 的公平基准。

查看 JevLab 代码与评测

研究视角

数字核查

数字只有连同来源、基线和适用任务一起看才有意义。厂商报价、独立实验和社区数量按不同口径展示。

$0.042 / 百万输入 token

输出免费;别名 jev-latest 当时指向 jev-1.13.0。价格和模型映射会变动。

官方文档 · 2026-09-19 快照
p50 约 264–276ms

同一基准对 Cerebras gpt-oss-120b 只快约 1.2 倍;不能把厂商的 20–200 倍外推到所有比较。

nibzard 独立基准 · v2
ECE 0.246

该任务中 Jev 承认不确定的比例约 49.7%;confidence 阈值不能未经校准就跨任务复用。

nibzard 独立基准 · 强制不确定题
63.3% 对 82.3%

开源 kev 对照官方 Jev 的准确率;同分布时差距很小,换任务后拉开。两者不是同一模型。

kev 作者自测 · 分布外对照
561 项

目录包含 SDK、Demo、文章及评测,不代表 561 个已验证的产品,更不等于真实生产采用。

Awesome Jev · 2026-09-19 社区快照

接入前必读

官方列出的 9 类失败模式

按 Jev 1.13 官方文档整理。尤其要在中文内容与自己的业务数据上重新测准确率和阈值。

  1. 01

    字面理解

    会照字面回答,而非揣测意图。

    建议:写明条件、否定和边界情形。

  2. 02

    数字与计数

    不擅长精确计算、计数和比较数值。

    建议:让代码完成可精确计算的部分。

  3. 03

    日期比较

    把日期当文本,不可靠地判断先后。

    建议:模型提取日期组件,代码负责排序和运算。

  4. 04

    间接推理

    双重否定与多跳问题更容易出错。

    建议:拆成直接、原子化的问题。

  5. 05

    冗长状态

    无关 state 会稀释与问题相关的信息。

    建议:先检索和过滤,再提交必要字段。

  6. 06

    对抗性内容

    输入中的诱导指令可能改变答案。

    建议:把外部内容视作数据并做针对性回归测试。

  7. 07

    冲突的标准

    instructions 与 criteria 不一致时容易混淆。

    建议:让二者同向描述判断标准。

  8. 08

    结构不变量

    Noul 与 Choice 的数值不能互换;正反问题也未必互补。

    建议:各原语单独校准,不跨形式套阈值。

  9. 09

    文本生成

    不能胜任文章或对话生成。

    建议:让 Jev 选择或评分,由生成模型写文字。

阅读官方原文

从原文开始

资料来源

官方信息、独立实验与社区目录分开阅读。项目数、点赞数和价格都有时间边界;统计口径不同的目录不能相加。

采集边界:本地资料存档了官方文档、社区目录、X 原帖、HN 讨论和独立评测;X 搜索与互动数并非完整、实时或穷举。模型架构、参数量和训练配方未获官方完整公开,不把逆向推断写成事实。

来自 traeai

站内追踪

搜索更多

下方文章按站内采集持续更新,与上方截至 2026-09-19 的研究快照分开维护。

AI 可能会生成不准确的信息,请核实重要内容