Jev AI

JEV と LLM の比較

Jev と LLM の比較は、突きつめると別々の仕事の比較だ。片方は書く係で、もう片方は判断する係。Jev と LLM のどちらが偉いかという話ではない。役に立つ問いはひとつ —— 自分のシステムのどの判断を Jev に移す価値があり、移したあと請求額と遅延がどう変わるのか。

目にする Jev と LLM の比較記事はほとんど、Jev をフロンティアのチャットモデルの隣に置いて「200 倍速い、400 倍安い」と告げる形をしている。どちらの数字も本当だ。ただし見出しが匂わせている意味ではない。この二つはそもそも同じ仕事をしていない。

Jev と LLM の役割はきれいに分かれている。テキスト LLM は汎用の器具で、向けた先について何であれ一段落書ける。Jev は専用の器具で、答えの範囲をこちらが先に描いた問いにだけ答え、しかも一文字も書かない。速度で Jev と LLM を比べるのは、電卓と会計士を暗算で比べるようなものだ。電卓が勝つが、その事実は誰を雇うべきかについて何も教えてくれない。

ここでやるのは役に立つほうの Jev と LLM の比較だ。Jev と LLM のどちらが優れているかではなく、いま動いているシステムのどの判断を Jev に移すべきか、移したときに遅延と請求額がどう動くかを見る。

JEV と LLM の比較が公平でない理由

あちこちで引用される二つの数字 —— 193.6 倍速い、444.6 倍安い —— の出どころは、Jev が Doom を遊ぶ録画デモだ。そのデモの中で Jev は 0.114 秒、0.000081 ドルで判断を出し、GPT-5.6 Terra は 8.566 秒、0.013880 ドルかかっている。Jev と LLM のある種の負荷についての正直な実測ではある。そしてその負荷は、Jev がまさにそのために作られた形 —— ごく小さな構造化状態、固定された動作の集合、毎分数千回の繰り返し —— だ。

一文を書く必要のある課題に変えたとたん、この Jev と LLM の比較は完全に崩れる。Jev はゼロ点になる。その一文を書けないからだ。これは Jev の出来が悪いのではなく、Jev がその道具ではないというだけの話だ。誠実な Jev と LLM の比較は、まず「この問いが成立する範囲」を囲うところから始まる。

Jev と LLM の差が意味を持つ範囲は狭いが、極端にありふれてもいる。答えの候補が有界で、高頻度に繰り返され、自分が何を聞きたいかをすでに知っているプログラムの内側で起きる判断。ルーティング、分類、基準に沿った採点、検証、ガードレール、再ランキング。ここでは Jev と LLM のコスト性能差は本物で、このページの残りはそれを測る作業になる。

Jev と LLM を項目ごとに

Jev と LLM を 7 つの項目で並べる。Jev と LLM を並べたとき、いちばん読む価値があるのは「信頼性」の行だ。Jev が返すのは確実性ではなく較正された確率で、確率であれば、コードは 0.95 のときと 0.55 のときでまったく違う動きができる。

項目JEVテキスト LLM
入力プログラムの状態と、事前に型を宣言した質問自然言語のプロンプト一つ
出力Choice・Score・Noul のいずれか。確信度が必ず付く自分で解析する必要のある自由文
スキーマで保証される。答えの範囲は呼び出し前に確定している構造なし。自分で制約と検証をかけない限り
信頼性較正された確率。ただし較正はコーパス次第で、保証ではない。事前登録された監査では、あるデータセットでは成立し(ECE 0.02)、別のデータセットでは崩れた(ECE 0.09、自信過剰)出力に較正された確信度は付かない
速度70〜500 ミリ秒、一度の並列処理数秒から数十秒。トークンを一つずつ生成する
コスト入力 100 万トークンあたり $0.042、出力は無料判断 1 件あたりのコストが 1〜2 桁高い
向いている用途答えの範囲が決まっていて、大量に繰り返す判断執筆・説明・自由な推論、そして文章を出す必要があるすべて

Jev と LLM のベンチマーク

下の Jev と LLM の比較表は TypeSafe 自身のベンチマークから来ている。711 のテストケース、4 種類のワークフロー。Jev と LLM が同じ課題を解いている。宣伝が前面に出さない列も含めて、表はそのまま置いてある。

モデル正答率1 件あたりのコストレイテンシ
Jev67.8%$0.00040.4s
GPT-5.6 Terra67.9%$0.030410.1s
GPT-5.6 Sol最高精度74.1%$0.083623.3s
Opus 573.1%$0.176137.8s
この表の正しい読み方: Jev は正答率で勝っていない。GPT-5.6 Terra と同等で、Sol と Opus 5 には 5〜6 ポイント及ばない。Jev が勝っているのは割に合うかどうかで、Terra とほぼ同じ正答率を約 76 分の 1 のコスト、25 分の 1 のレイテンシで出している。 TypeSafe 自身による 4 ワークフロー・711 ケースのベンチマーク。ベンダー発表であり、この表そのものを誰かが再現したわけではない。ここでいう正答率はモデルが生成した参照解との一致度であって、客観的な正しさではない。Jev に対する第三者評価は存在する。下に並べた。

Jev と LLM を比べるときは、先に精度を見て、それからコストを見る。Jev はこの列で勝っていない。GPT-5.6 Terra と並び、GPT-5.6 Sol と Opus 5 には 5〜6 ポイント届かない。スイート内で最も弱い請求書処理では、その差は総合値が見せるよりずっと大きい。

Jev が勝っているのは比率だ。Terra とほぼ同じ精度を、およそ 76 分の 1 のコストと 25 分の 1 の遅延で取っている。自分の判断が Terra の水準で足りるなら —— ルーティングや振り分け、フィルタ系の判断はたいてい足りる。確信の持てないものはどのみち人か大きいモデルに回るからだ —— この Jev と LLM の比較において Jev は妥協ではなく、二桁安い代価で同じ答えを得る手段になる。

逆に Sol や Opus の水準が必須で、確信度のしきい値でも受け止めきれないなら、Jev は答えではない。いくら安くてもそこは動かない。

Jev と LLM の比較に出てくるベンチマークの数字には、このページのものも含めて注意書きを二つ添えるべきだ。重みは公開されておらず、上の表は Jev を売っている当人が採点している。誰かが再現したわけではない。そして精度と呼ばれているものは、モデルが生成した参照解との一致度であって、客観的な正しさとは別物だ。社外の手による評価は、いまはある。下に並べた。そちらも Jev に甘くはない。

Jev の第三者による評価

上の表は TypeSafe 自身のものだ。ここから下にある四つの Jev 評価は違う。いずれも社外の人間が、標本を明示したうえで走らせ、生の数字を公開している。うち三つは事前登録されている。最初の Jev 呼び出しより前に手順を凍結してハッシュを取っているので、あとから判定基準を動かすことはできない。この四つが、いま手に入る Jev の実力についていちばん硬い証拠になる。Jev に不利な結論も削らずそのまま載せている。

  1. Jevals.com

    Jev と LLM に同じ設問を当てた独立の比較だ。PubMedQA の Yes/No では Jev が 69.0、Gemini 3.8 Flash が 73.0。Jev は統計的には大規模言語モデル六つの最上位と互角で、価格は 28 分の 1 だ。Banking77 の多肢選択では Jev 67.8 に対し Gemini 74.1 で、ここでは Jev は追いつけていない。HelpSteer2 の採点課題では、Jev を含めてどのモデルもラベルの基礎率で当てずっぽうに答えるのをはっきり上回れなかった。Jev の判断ごとの確率はすべて CC BY 4.0 で公開されているので、誰でも自分で数え直せる。

    標本: 7 models × 3 task types × 300 items × 5 runs = 31,500 scored decisions

  2. ASSAY-001 (Jourdan Labs)事前登録

    Jev は「較正されている」という主張に対する結論は半々だった。CLINC150 では Jev の確信度と実際の正答率の差がどの区間でも 2.5 ポイント以内に収まった(ECE 0.0204)。Banking77 では成立しない(ECE 0.0936)。Jev は確信度 0.86 と称しておいて、実際に正しかったのは 67% で、系統的な自信過剰だった。一方、型の安全性は完全に保たれた。8,576 回の Jev 応答のうち、与えた選択肢の外を答えたものは一つもない。「Jev は幻覚を起こさない」という言い方のうち、第三者に裏を取られているのはこの部分だけだ。

    標本: Banking77 3,080 items + CLINC150 5,496 items

  3. jev-acento (Marcos Martinez)事前登録

    Jev に渡す state を英語ではなくスペイン語で書くと、Jev の正答率は XNLI・PAWS-X・MASSIVE・Belebele のいずれでも 3.0〜6.4 ポイント落ち、較正誤差はおよそ倍になった(XNLI で 0.057 → 0.101)。自動で通せる割合(p ≥ 0.9)は 72.2% から 63.4% へ下がる。対して Jev への instructions をスペイン語にしても、変化は何も出なかった。つまり state はデータの言語に従い、instructions は英語のままにしておくのがよい。

    標本: 3,200 paired human-labelled items, 19,200 calls, jev-1.13.0 version-pinned

  4. 較正誤差は Jev が 0.1472、GPT-4.1 が 0.2393。請求額は Jev が 4.02 ドル、GPT-4.1 がおよそ 136 ドルで、34 分の 1 ほどだった。それより憶えておく価値があるのは問いの設計の話だ。同じ Jev に訊くのでも、Yes/No の設問を二択の Choice ではなく Noul として尋ねると、モデルを取り替えるより結果が動いた。Jev を使ううえでは、どのモデルを選ぶかより問いをどう型に落とすかのほうが効く。

    標本: 300 synthetic respondents × 108 questions, Twin-2K-500

コスト計算

500,000
1K10M
800
1008,000
$16.80
JEV
$800.00
GPT-5.6 TERRA
$2,200
GPT-5.6 SOL
$4,640
OPUS 5
48× 次に安い選択肢より安い

Jev's price is TypeSafe's published rate. The comparison rates are the per-case costs in the same benchmark, converted back to an input-token rate — treat them as order-of-magnitude, not a quote. Checked 2026-09-21.

JEV と LLM の遅延差はどこから来るか

TypeSafe が Jev に与えているエンドツーエンドの所要時間は 70〜500 ミリ秒。Jev と LLM の遅延を比べる前に、この幅の理由を押さえておきたい。幅が広いのは、ごく小さな Jev の Noul 一つのケースと、十数個の質問と数キロバイトの状態を載せたリクエストの両方を含むからだ。そして肝心なのは、その二つの差が直感よりずっと小さいという点にある。

Jev と LLM の差の理由は並列サンプラーにある。テキスト LLM はトークンを順に生成するので、答えが長いほど時間がかかる。Jev はリクエスト内の答えを一度に出すので、一回の Jev 呼び出しに 5 つ目、6 つ目の質問を足しても針はほとんど動かない。追加で払うのはその質問ぶんの入力トークンくらいだ。

ここから、Jev にしかできない投機的ファンアウトという書き方が開く。役に立つかもしれない質問をぜんぶ投げ、結局使わなかった答えをコードで捨てる。テキスト LLM で同じことをするのは筋が通らない —— 捨てる生成に金を払うからだ。Jev では出力が無料で並列なので、6 つ聞くのと 2 つ聞くのがほぼ同じになる。

ベンチマークの実測値は Jev が 1 ケース 0.4 秒、Terra が 10.1 秒。0.1 秒台と 10 秒の Jev と LLM の比較は最適化の話ではなく、「その判断をリクエストの経路に置けるか」と「キューに追い出すしかないか」の違いだ。

JEV はなぜここまで安いのか

Jev と LLM のあいだの二桁の価格差は、たいてい誰かが何かを補助している合図なので、この Jev と LLM の差額が構造的なのか販促的なのかは確かめる価値がある。

Jev と LLM のコスト構造は、生成の有無でほぼ決まる。テキストモデルを動かすコストの大半は生成にある。答えの中の 1 トークンごとに順伝播が 1 回走るので、三文書くモデルはそのために 100 回以上の逐次計算をしている。Jev はトークンを出さない。入力を一度読み、答えを並列にサンプリングし、浮動小数点数をいくつか返すだけだ。払うべき生成フェーズが存在しない。TypeSafe が Jev の出力を無料に設定し、「計測する価値もないほど安い」と言えるのはこのためだ。

Jev と LLM のもう一つの差は規模だ。Jev はソネットを書く必要も、契約書を要約する必要も、Rust をデバッグする必要もない。誰もそれを頼まないからだ。狭い一つのことのために作られたモデルは、汎用モデルよりはるかに小さくできて、そのことについてはなお競争力を保てる。ベンチマーク表が見せているのはまさにこれで、Jev は判断系の課題でフロンティアモデルの精度に並び、それ以外のすべてで完全に落第する。

Jev と LLM について正直な言い方をすればこうなる。Jev は LLM の安い版ではない。Jev は、ほぼすべての能力を手放す代わりに、一つのことを上手にほぼ無料でやれるようにした小さなモデルだ。この交換が割に合うかどうかは、必要なものがちょうどその一つかどうかで決まる。

JEV と LLM、どちらをいつ使うか

これは Jev に移す

  • 同じ判断が 1 日に数千回走り、コストがもう請求書に見え始めている。
  • 答えの候補が呼び出し前にすべて分かっている —— 固定されたルート、段階、あるいは真偽。
  • 遅延がユーザーの目の前にある、またはその判断が数秒も待てないループの中にある。
  • 盲信するしかないラベルではなく、コードがしきい値を置ける確信度がほしい。
  • いま高い金を払って一語の答えをモデルに聞き、それを文から取り出している。

これはテキストモデルに残す

  • 出力のどこかに「選ぶ」ではなく「書く」が要る —— 返信、要約、ツールの引数。
  • 答えが数段の連鎖した推論に依存する。ここでは Jev の精度が目に見えて落ちる。
  • 入力が画像・音声・動画。Jev が食べるのはテキストと構造化状態だけだ。
  • 答えに理由が要る。Jev が返すのは数字であって説明ではない。
  • その判断が不可逆で影響が大きく、どんな確信度のしきい値でも残余リスクを許容範囲に収められない。

JEV と LLM を並走させる

現実には、Jev と LLM の比較の結論が「LLM を置き換える」になることはまずない。ほぼ必ず「LLM の手前に Jev を一枚置く」になる。この形は、このサイトが索引している Jev のプロジェクトの中で繰り返し現れるので、名前をつける価値がある —— Jev は安い関門、LLM は高い職人、しきい値はコードの持ち物。

Jev と LLM を並走させる形はいくつかある。モデルルーターは、まず Jev にこのリクエストの難しさを聞き、易しいものは小さいモデルへ、難しいものは大きいモデルへ流す。安全ゲートは、まず Jev にそのツール呼び出しが破壊的かを聞き、危ないものだけをレビュー用のモデルか人に上げる。RAG のパイプラインは、まず Jev に各段落が本当に主張を支えているかを聞き、支えていないものを執筆モデルが見る前に捨てる。

どの形でも、Jev と LLM は競争していない。そのリクエストにどれだけの LLM を割り当てるかを決めている。このページの Jev と LLM のコスト比較が、実際の節約を過小評価している理由もここにある。判断を Jev に移すということは、多くの場合その高い呼び出しを安くするのではなく、まるごと取り消すことだからだ。

判断パターン

Jev と LLM の比較についてのよくある質問

Jev と LLM、どちらが安い?
Jev と LLM の差はかなり大きい。Jev は入力 100 万トークンあたり 0.042 ドルで出力は無料、汎用モデルは 100 万トークンあたり数ドルだ。ベンチマークの 1 ケースあたりで見ると Jev が 0.0004 ドル、GPT-5.6 Terra が 0.0304 ドル —— 同じ作業量で約 76 倍の開きがある。
Jev と LLM、どちらが速い?
判断系の仕事では、Jev と LLM を比べると Jev が 1〜2 桁速い。ベンチマークの実測で Jev は 1 ケース 0.4 秒、GPT-5.6 Terra は 10.1 秒。差はアーキテクチャから来ている。Jev は答えを一度に並列で出し、トークンを順に生成しない。
Jev と LLM、どちらが正確?
Jev と LLM では LLM のほうが正確だ。TypeSafe 自身のベンチマークで Jev は 67.8%、GPT-5.6 Terra の 67.9% と並び、GPT-5.6 Sol の 74.1% と Opus 5 の 73.1% を下回る。Jev の強みはその精度に払う代価であって、精度そのものではない。
Jev は手元の LLM を置き換えられる?
Jev と LLM を入れ替えられるのは、システムの中で「書く」ではなく「選ぶ」部分だけだ。多くのチームは最終的に両方を走らせ、Jev を安い関門として使って、リクエストごとに高いモデルをどれだけ使うかを決めている。
Jev は LangChain や Vercel AI SDK で使える?
Jev はどちらでも使える。LangChain には langchain-typesafe と TypeSafeClassifier があり、Vercel AI SDK は experimental evaluate 経由で Jev を typesafe-ai/jev として公開している。Pydantic AI と Cloudflare Workers AI でも Jev は使える。