JEV 对比大模型
Jev 对比大模型,本质上是两件不同工作的对比。一个负责写,一个负责判断。真正有用的问题是:你系统里哪些判断值得挪到 Jev 上,挪过去之后账单和延迟会变成什么样。
你能读到的几乎每一篇 Jev 对比文章,都是把 Jev 摆在前沿聊天模型旁边,然后告诉你快两百倍、便宜四百倍。这两个数字都是真的。但它们都不是标题暗示的那个意思,因为这两个模型做的根本不是同一件事。
文本大模型是通用仪器,你指向什么它就能就什么写出一段话。Jev 是专用仪器,它回答的是那些你事先把答案范围画好了的问题,而且它一个字都不写。拿速度去做 Jev 对比,有点像拿计算器跟会计比算术——计算器赢了,但这句话对你该雇谁没有任何帮助。
下面要做的是真正有用的那种 Jev 对比:不是比谁更好,而是搞清楚一个正在运行的系统里,哪些判断该挪到 Jev 上,挪过去之后延迟和账单会怎么变。
JEV 对比大模型为什么不公平
被到处引用的那两个数字——快 193.6 倍、便宜 444.6 倍——来自一段 Jev 玩 Doom 的录像演示。在那段演示里,Jev 用 0.114 秒、0.000081 美元给出一个判断,而 GPT-5.6 Terra 是 8.566 秒、0.013880 美元。这是对某一种工作负载的诚实测量,而那种负载恰好就是 Jev 被造出来的形状:极小的结构化状态、固定的动作集合、每分钟成千上万次重复。
换成一个需要写出一句话的任务,这个 Jev 对比就彻底垮了,因为 Jev 得零分——它写不出那句话。这不是 Jev 表现差,是 Jev 不是那把工具。任何诚实的 Jev 对比,都得先把「这个问题在哪个范围里才成立」圈出来。
这个范围很窄,但极其常见:答案范围有界、高频重复、发生在一个已经知道自己要问什么的程序内部。路由、分类、按细则打分、校验、防护栏、重排序。在这些地方,Jev 对比大模型的性价比差距是真实的,本页剩下的部分就是在量它。
Jev 对比大模型:逐项拆开
Jev 对比大模型,七个属性并排看。最值得看的是「可靠性」那一行:Jev 给你的不是确定性,而是一个校准过的概率,而概率这个东西,你的代码在 0.95 和 0.55 的时候可以采取完全不同的动作。
| 属性 | JEV | 文本大模型 |
|---|---|---|
| 输入 | 程序状态,加上事先声明好的类型化提问 | 一段自然语言 prompt |
| 输出 | 一个 Choice、Score 或 Noul,每个都附带置信度 | 需要你自己解析的自由文本 |
| 类型 | 由 schema 保证;答案空间在调用前就已固定 | 无结构,除非你自己约束并校验 |
| 可靠性 | 校准过的概率——但校准跟语料有关,不是保证:一次预注册审计里它在一个数据集上成立(ECE 0.02),在另一个上失效(ECE 0.09,过度自信) | 输出不带校准过的置信度 |
| 速度 | 70–500 毫秒,一次并行运算 | 几秒到几十秒,逐 token 生成 |
| 成本 | 每百万输入 token 0.042 美元,输出免费 | 单次判断的成本高一到两个数量级 |
| 适合做什么 | 答案范围有界、高频重复的判断 | 写作、解释、开放式推理,以及任何需要产出语句的场景 |
Jev 对比的基准成绩
下面这张 Jev 对比表来自 TypeSafe 自己的基准:711 个测试用例,四组工作流。整张表都在这里,包括营销口径不会放在前面的那一列。
| 模型 | 准确率 | 单次成本 | 延迟 |
|---|---|---|---|
| Jev | 67.8% | $0.0004 | 0.4s |
| GPT-5.6 Terra | 67.9% | $0.0304 | 10.1s |
| GPT-5.6 Sol准确率最高 | 74.1% | $0.0836 | 23.3s |
| Opus 5 | 73.1% | $0.1761 | 37.8s |
先看准确率,再看成本。Jev 在这一列没赢——它与 GPT-5.6 Terra 打平,比 GPT-5.6 Sol 和 Opus 5 低 5 到 6 个百分点。在套件里最弱的子项发票处理上,差距比汇总数字显示的大得多。
Jev 赢的是比值。拿到跟 Terra 差不多的准确率,只花大约 1/76 的成本、1/25 的延迟。如果你的判断能接受 Terra 那个档次的准确率——大多数路由、分诊、过滤类判断都能,因为不确定的那些本来就会被人或更大的模型复核——那这笔 Jev 对比里,Jev 不是妥协,而是用低两个数量级的代价拿到同一个答案。
如果你的判断必须达到 Sol 或 Opus 那个档次,而且没法用置信度阈值兜住,那 Jev 就不是答案,省多少钱都不改变这一点。
关于任何 Jev 对比里的基准数字,都该附两句提醒,包括这一页上的:权重没有公开,上面那张表是卖 Jev 的人自己打的分,没有别人复现过;而所谓准确率,衡量的是与模型生成的参考答案的一致度,跟客观正确不是一回事。独立做的评测现在是有的——列在下面,而且它们对 Jev 也谈不上客气。
对 Jev 的独立第三方评测
上面那张表是 TypeSafe 自己做的。下面这四项对 Jev 的评测不是:每一项都由公司外的人跑出来,样本写明,原始数字公开。其中三项是预注册的——方案在发出第一次 Jev 调用之前就冻结并取了哈希,事后没法再改判定标准。这四项加起来,是目前能拿到的、关于 Jev 实际表现的最硬的证据。
PubMedQA 的是非题上,Jev 得 69.0,Gemini 3.8 Flash 得 73.0——Jev 在统计意义上与六个大模型里最好的那个打平,价格是它的 1/28。Banking77 的多选题上,Jev 得 67.8,Gemini 得 74.1,Jev 这次没能追平。HelpSteer2 的评分题上,包括 Jev 在内没有一个模型明显赢过按标签基准率瞎猜。Jev 每一个判断的概率都按 CC BY 4.0 公开了,谁都可以自己复算。
样本: 7 models × 3 task types × 300 items × 5 runs = 31,500 scored decisions
对 Jev「校准过」这个说法给出的是一半一半的结论。CLINC150 上成立:Jev 的置信度与实际正确率每一档差距都在 2.5 个百分点以内(ECE 0.0204)。Banking77 上不成立(ECE 0.0936)——Jev 声称 0.86 的置信度,实际只对了 67%,是系统性的过度自信。类型安全这一条则完全站住:8576 次 Jev 响应里,没有一次答出给定选项之外的东西。这是「Jev 不会幻觉」这句话唯一被独立验证过的部分。
样本: Banking77 3,080 items + CLINC150 5,496 items
给 Jev 的 state 用西班牙语写而不是英语,Jev 在 XNLI、PAWS-X、MASSIVE、Belebele 上一律掉 3.0 到 6.4 个百分点,校准误差大约翻倍(XNLI 从 0.057 到 0.101)。可自动放行的比例(p ≥ 0.9)从 72.2% 降到 63.4%。而把给 Jev 的 instructions 改成西班牙语,什么变化都没有——所以结论是 state 跟着数据走,instructions 一律留英文。
样本: 3,200 paired human-labelled items, 19,200 calls, jev-1.13.0 version-pinned
Jev 的校准误差是 0.1472,GPT-4.1 是 0.2393;Jev 的账单是 4.02 美元,GPT-4.1 大约 136 美元,约三十四分之一。更值得记住的是关于提问设计的那条:同样问 Jev,把一个是非题写成 Noul 而不是两选项的 Choice,对结果的影响比换模型还大。也就是说用 Jev 的时候,问题怎么定型比选哪个模型更要紧。
样本: 300 synthetic respondents × 108 questions, Twin-2K-500
成本计算器
Jev's price is TypeSafe's published rate. The comparison rates are the per-case costs in the same benchmark, converted back to an input-token rate — treat them as order-of-magnitude, not a quote. Checked 2026-09-21.
JEV 对比大模型的延迟差在哪
TypeSafe 给 Jev 的端到端耗时是 70 到 500 毫秒。跨度这么大,是因为它既涵盖了一个极小的 Noul,也涵盖了一次带十几个问题、好几 KB 状态的请求——而关键在于,这两种情况的差距远比直觉上小。
这是并行采样器带来的。文本大模型逐 token 生成答案,所以答案越长耗时越多;Jev 把请求里的所有答案一次性产出,所以往一次 Jev 调用里加第五个、第六个问题,几乎不动表针。你多付的只是那几个问题的输入 token,别的基本不付。
这解锁的设计手法叫投机式扇出:把所有可能有用的都问了,再让代码丢掉最后用不上的。在文本大模型上这么干说不过去——你在为丢掉的生成付钱;在 Jev 上,输出免费且并行,问六个和问两个几乎一样。
基准里的实测值是 Jev 每个用例 0.4 秒,Terra 10.1 秒。十分之一秒和十秒的 Jev 对比,不是优化,而是「这个判断能不能放在请求链路里」和「必须挪进队列」的区别。
JEV 为什么能这么便宜
两个数量级的价格差,通常意味着有人在补贴什么,所以值得搞清楚 Jev 对比出来的这个差价是结构性的还是促销性的。
跑一个文本模型,成本大头在生成。答案里的每一个 token 都是一次前向计算,一个给你写三句话的模型,为此做了一百多次串行计算。Jev 不产出 token,它读一遍输入、并行采样出所有答案、返回几个浮点数。没有生成阶段要付钱,这就是为什么 TypeSafe 能把 Jev 的输出定价为零,还说它「便宜到不值得计量」。
第二个因素是体积。Jev 不需要会写十四行诗、会总结合同、会 debug Rust,因为永远不会有人这么要求它。一个只为一件窄事造的模型,可以比通用模型小得多,同时在那件事上仍有竞争力——基准表显示的正是这个:Jev 在判断类任务上追平了前沿模型的准确率,而在其余所有事情上彻底不及格。
诚实的说法是:Jev 不是大模型的便宜版。Jev 是一个放弃了几乎所有能力、换取在一件事上做到又好又近乎免费的小模型。这笔交换划不划算,完全取决于你需要的是不是恰好就是那一件事。
JEV 对比大模型:什么时候用哪个
这些挪到 Jev
- 同一个判断每天跑几千次,成本已经开始出现在账单上。
- 所有可能的答案在调用前就已知——一组固定的路由、档位,或者一个是非。
- 延迟挡在用户前面,或者这个判断在一个等不起几秒的循环里。
- 你想要一个代码能设阈值的置信度,而不是一个只能盲信的标签。
- 你现在正在花大价钱问一个模型要一个词的答案,然后从句子里把它解析出来。
这些留给文本模型
- 输出里有任何部分需要「写」而不是「选」——回复、摘要、工具参数。
- 答案依赖好几步相互串联的推理,Jev 在这里的准确率会明显下降。
- 输入是图片、音频或视频。Jev 只吃文本和结构化状态。
- 你需要答案附带理由。Jev 只给你一个数字,不给解释。
- 这个判断不可逆且后果重大,而且没有任何置信度阈值能让剩余风险变得可接受。
JEV 对比之外:两个一起跑
实际上,一次 Jev 对比的结论几乎从来不是「换掉大模型」,而是「在大模型前面加一道 Jev」。这个模式在本站索引的项目里重复出现到值得起个名字:Jev 是便宜的闸门,大模型是昂贵的工人,阈值归代码管。
模型路由器先问 Jev 这次请求有多难,再把简单的发给小模型、难的发给大模型。安全闸门先问 Jev 这次工具调用会不会造成破坏,只把有风险的升级给复核模型或人。RAG 管道先问 Jev 每个召回段落是不是真的支撑了那个论断,把不支撑的在写作模型看到之前就丢掉。
在这每一种形态里,Jev 都不是在跟大模型竞争,而是在决定这次请求配得上多少大模型。这也是为什么本页的成本对比其实低估了真实节省:把一个判断挪到 Jev 上,往往是把那次昂贵调用整个取消了,而不是让它变便宜。
JEV 对比常见问题
- Jev 对比大模型,哪个更便宜?
- 差距很大。Jev 是每百万输入 token 0.042 美元、输出免费,通用模型是每百万几美元。按基准里的单次成本算,Jev 是 0.0004 美元,GPT-5.6 Terra 是 0.0304 美元——同样的工作量,差约 76 倍。
- Jev 对比大模型,哪个更快?
- 在判断类工作上 Jev 快一到两个数量级。基准实测 Jev 每个用例 0.4 秒,GPT-5.6 Terra 是 10.1 秒。差距来自架构:Jev 一次并行产出所有答案,而不是逐 token 生成。
- Jev 对比大模型,哪个更准?
- 大模型更准。在 TypeSafe 自己的基准上 Jev 得 67.8%,与 GPT-5.6 Terra 的 67.9% 打平,低于 GPT-5.6 Sol 的 74.1% 和 Opus 5 的 73.1%。Jev 的优势是拿到这个准确率所付的代价,不是准确率本身。
- Jev 能替掉我的大模型吗?
- 只能替掉你系统里「选」而不是「写」的那部分。大多数团队最后是两个一起跑,用 Jev 当便宜的闸门,决定每次请求真正需要多少昂贵模型。
- Jev 支持 LangChain 或 Vercel AI SDK 吗?
- 都支持。LangChain 有 langchain-typesafe 和 TypeSafeClassifier,Vercel AI SDK 通过 experimental evaluate 路径把 Jev 暴露为 typesafe-ai/jev。Pydantic AI 和 Cloudflare Workers AI 也都提供 Jev。
- Jev 不确定的时候会怎样?
- 它会告诉你——每个答案都附带置信度。因为 Jev 是为校准训练的,0.55 确实更接近抛硬币,0.95 确实更可靠,这才让你在代码里设阈值这件事有意义,而不是迷信。
- Jev 对比里的基准有第三方验证吗?
- 没有。没有第三方评测、没有公开权重、没有开放测试集。本页的基准是 TypeSafe 自己的,其准确率一列衡量的是与模型生成的参考答案的一致度,不是客观正确率。用对待任何厂商自报数据的方式对待它。