Julia-1 vs Jev:ローカルとクラウドの意思決定モデル比較(2026)
Julia-1は、mmBERT-small上に構築されたApache 2.0ライセンスの144.3Mパラメータ意思決定モデルで、分類とルーティングのためにCPUでローカルに動作します。Jevは、TypeSafe AIが数日前に大きなメディア報道とともに発表したクラウド意思決定モデルで、パラメータ数は非公開のクローズドAPIです。両者ともテキストを生成するのではなく、固定された回答候補のリストをスコアリングします——違いはそれぞれがどこで動作するかです。
クイック回答
Julia-1とJevはどちらも、自由なテキストを生成する代わりに固定された回答候補リストをスコアリングする「意思決定モデル」ですが、デプロイの両極端に位置します。Julia-1はSupersonic Labsによる144.3MパラメータのApache 2.0ライセンスモデルで、APIキーやトークンごとのコストなしにCPUで動作します。JevはTypeSafe AIのクローズドなクラウドAPIで、入力トークンごとに課金され、パラメータ数やオープンウェイトは公開されていません。
- ▸Julia-1:144.3Mパラメータ、Apache 2.0、CPUでローカル動作、ディスク上で約550 MB
- ▸Jev:TypeSafe AI製のクラウド専用API、入力100万トークンあたり$0.042、アーキテクチャ非公開
- ▸両者とも自由なテキストを生成するのではなく固定された回答候補をスコアリング——同じ新興カテゴリー「意思決定モデル」
重要なポイント
- ✓Julia-1(Supersonic Labs)は、mmBERT-small上に構築されたApache 2.0ライセンスの144.3Mパラメータ意思決定モデル——CPUで動作し、APIキー不要、ディスク上で約550 MB
- ✓Jev(TypeSafe AI)は、クローズドなクラウド専用の意思決定モデルで、September 15, 2026に大きなメディア報道とともにローンチ——価格は入力100万トークンあたり$0.042、アーキテクチャは非公開
- ✓両者とも、テキストを生成するのではなく2~20個の候補回答の固定リストをスコアリング——同じ「意思決定モデル」カテゴリーだが、デプロイモデルは正反対
- ✓Julia-1とJevを同一タスクで直接比較した公開ベンチマークはまだ存在しない
Julia-1とは何か?
Julia-1は、ジョンズ・ホプキンス大学の言語音声処理センター(CLSP)による多言語エンコーダーmmBERT-small上に、Supersonic Labsが構築した144.3Mパラメータの意思決定モデルです。コンテキスト、質問、2~20個の候補回答が与えられると、Julia-1は各選択肢をスコアリングし、最良のものを返します——自由なテキストは生成しません。
このモデルはmmBERT-smallの注意機構レイアウトを引き継いでいます:3層ごとに1層が入力全体にグローバルに注意を向け、それ以外の層は±64トークンのローカルウィンドウ内のみに注意を向けます。256,000行の語彙埋め込みは144Mの総パラメータのうち98Mを占め、1回のリクエストでは実際に使用されるトークンの埋め込み行のみを読み込みます——これがGPUなしでCPUで動作できる理由の一つです。
Julia-1はApache 2.0ライセンスで提供され、ディスク上で550.5 MiB(FP32重み)を占め、コンテキスト・質問・候補回答を合わせて最大8,192トークンを受け付けます。対象は分類、ルーティングの決定、順序付きスコアリング、Yes/No判定です——これは、AIエージェントがツールを呼び出したりチケットをエスカレーションしたりする前に下すような固定選択肢の意思決定であり、オープンエンドな生成ではありません。
そのベースモデルであるmmBERT-small自体も注目に値します:JHU CLSPが訓練したのは、MITライセンスの下で1,800を超える言語(最終訓練フェーズでは1,833言語)です。この数字はmmBERT-smallの事前学習カバー範囲を示すものです——Julia-1自体の精度はMASSIVEベンチマークにおける52のロケールでしか測定されていないため、1,800言語という数字はベースモデルに関する事実として扱い、Julia-1自体の多言語精度についての主張とは見なさないでください。
Julia-1の精度はどの程度か?
Julia-1はAG News(4ラベルのトピック分類)で94/100、DAIR Emotionベンチマーク(6ラベル)で86/100のスコアを記録しており、いずれもSupersonic Labsによるベンダー報告値です。52ロケールのMASSIVE意図理解ベンチマークでは154,648件中110,573件(71.5%)を正しく回答し、タイプ付き決定の混合セットでは2,000件中1,463件(73.15%)のスコアを記録しています。
最も弱い結果は、72ラベルの銀行業界向け意図理解ベンチマークBanking77における100サンプルのパイロットテストです:Julia-1は87%の基準スコアに対して64/100のスコアでした。Supersonic Labs自身のモデルカードは、「100サンプルのパイロットテストは励みになるシグナルであり、保証ではない」と明確に述べ、Banking77の72カテゴリーのような長く曖昧なラベルセットをJulia-1の現在の弱点として挙げています。
これらの数値はいずれも、公開時点でSupersonic Labs自身のモデルカード以外では独立して再現されていません——第三者による検証があるまではベンダー報告値として扱ってください。
| ベンチマーク | ラベル数 | スコア | 情報源 |
|---|---|---|---|
| AG News | 4 | 94/100 | ベンダー報告 |
| DAIR Emotion | 6 | 86/100 | ベンダー報告 |
| MASSIVE(52ロケール) | 意図セット | 71.5%(110,573/154,648) | ベンダー報告 |
| Banking77(パイロット) | 72 | 64/100 vs. 87%基準 | ベンダーパイロット、100サンプル |
Julia-1をローカルで動かすべきか、Jevのクラウド APIを使うべきか?
September 15, 2026にTypeSafe AIがローンチしたJevは、Julia-1のローカルアプローチに対するクラウド版であり、はるかに大きな注目を集めました。ローンチ動画はX上で約40 million回の再生数を獲得し、TypeSafe AIは発表を前後してDCVCが主導する$40 millionのシードラウンドを調達し、投資家はそれ以降、$10 billionを超える評価額で同社に接触しているとBloombergの報道は伝えています。
Jevは元OpenAI研究者によって構築され、「System 1」モデルとして位置づけられています:テキストではなく、ルーティング、スコアリング、トリアージ、モデレーションのためのタイプ付きで較正された決定を返します——これはJulia-1と同じタスクカテゴリーです。Julia-1と異なり、JevはDigitalOceanのModel Catalogなどのパートナーを通じたクラウドAPIとしてのみ利用可能です。TypeSafe AIはJevのパラメータ数やモデルアーキテクチャを公開しておらず、外部の観測者は未確認ながら、オープンウェイトの基盤上に構築されたトランスフォーマーであろうと推測しているにすぎません。
価格設定はダウンロード後無料ではなく、トークン単位です:Jevは入力100万トークンあたり$0.042を課金し、出力トークンは現在無料で、TypeSafe AIは標準的なクラウドAPI条件下で70–500ミリ秒のエンドツーエンドレイテンシを報告しています。JevとJulia-1を同一タスクセットで直接評価した公開ベンチマークはまだありません——両者は同じタスクセットで評価されていません。
意思決定モデルのカテゴリー以外のCPU専用ローカル環境については、CPU専用マシン向けのベストなOllamaモデルを参照してください。
よくある質問
「意思決定モデル」とは何ですか。LLMとの違いは何ですか?▾
Julia-1はチケットルーティングにおけるLLM呼び出しを置き換えられますか?▾
Julia-1は無料で使えますか?▾
JevはJulia-1のようにローカルで動作しますか?▾
Jevの利用にはどのくらいの費用がかかりますか?▾
mmBERT-smallとは何ですか。Julia-1と同じものですか?▾
実際のタスクにおけるJulia-1の精度はどの程度ですか?▾
Julia-1とJevを同一のベンチマークで直接比較した例はありますか?▾
詳しく読みたいですか?
コンプリートガイドを読む →関連する Prompt Bites