Skip to main content
PromptQuorumBuilt for humans. Structured for AI.

Julia-1对比Jev:本地与云端决策模型(2026)

Julia-1是一个基于mmBERT-small构建的144.3M参数、Apache 2.0许可的决策模型,可在CPU上本地运行,用于分类和路由任务。Jev是TypeSafe AI几天前发布并引发大量媒体报道的云端决策模型,是一个未公布参数数量的闭源API。两者都是对一份固定的答案选项列表进行打分,而非生成文本——区别在于各自的运行位置。

快速回答

Julia-1和Jev都是「决策模型」,用于对一份固定的答案选项列表打分,而非生成自由文本,但两者处于部署方式的两个极端。Julia-1是Supersonic Labs推出的144.3M参数、Apache 2.0许可的模型,可在CPU上运行,无需API密钥或按token付费。Jev是TypeSafe AI的闭源云端API,按输入token计费,未公布参数数量或开放权重。

  • ▸Julia-1:144.3M参数,Apache 2.0,在CPU上本地运行,磁盘占用约550 MB
  • ▸Jev:TypeSafe AI推出的纯云端API,每百万输入token收费$0.042,架构未公开
  • ▸两者都是对固定答案选项打分而非生成文本——同属新兴的「决策模型」类别
Model Comparisons中级

关键要点

  • ✓Julia-1(Supersonic Labs)是一个基于mmBERT-small的144.3M参数、Apache 2.0许可决策模型——可在CPU上运行,无需API密钥,磁盘占用约550 MB
  • ✓Jev(TypeSafe AI)是一个闭源、纯云端的决策模型,于September 15, 2026发布并引发大量媒体报道——定价为每百万输入token收费$0.042,架构未公开
  • ✓两者都是对2到20个候选答案的固定列表打分而非生成文本——同属「决策模型」类别,但部署方式截然相反
  • ✓目前尚无公开基准测试对Julia-1和Jev在同一任务上进行过正面比较

Julia-1是什么?

Julia-1是Supersonic Labs基于mmBERT-small构建的144.3M参数决策模型,mmBERT-small是约翰斯·霍普金斯大学语言与语音处理中心(CLSP)推出的多语言编码器。给定一个上下文、一个问题和2到20个候选答案,Julia-1会对每个选项打分并返回最佳答案——它不生成自由文本。

该模型沿用了mmBERT-small的注意力布局:每三层中有一层对整个输入进行全局关注,其余层仅在±64个token的局部窗口内关注。一个含256,000行的词表嵌入占用了144M总参数中的98M,而单次请求只会读取实际用到的token所对应的嵌入行——这是该模型无需GPU即可在CPU上运行的原因之一。

Julia-1以Apache 2.0许可发布,磁盘占用550.5 MiB(FP32权重),可接受上下文、问题与候选答案合计最多8,192个token。它面向分类、路由决策、有序打分和是/否判断——这类是AI代理在调用工具或升级工单之前做出的固定选项决策,而非开放式生成。

其基础模型mmBERT-small本身也值得关注:JHU CLSP在MIT许可下用超过1,800种语言(最终训练阶段为1,833种)对其进行了训练。这个数字描述的是mmBERT-small的预训练覆盖范围——Julia-1自身的准确率仅在MASSIVE基准测试的52个语言区域上测得,因此应将1,800种语言这一数字视为关于基础模型的事实,而非关于Julia-1自身多语言准确率的说法。

Julia-1的准确率如何?

Julia-1在AG News(4标签主题分类)上得分94/100,在DAIR Emotion基准测试(6个标签)上得分86/100,两者均由Supersonic Labs自行报告。在覆盖52个语言区域的MASSIVE意图基准测试中,它在154,648个条目中正确回答了110,573个(71.5%),在混合类型化决策集上得分1,463/2,000(73.15%)。

较弱的结果来自Banking77(一个72标签的银行业意图基准测试)上的100样本试点:Julia-1得分64/100,而参考分数为87%。Supersonic Labs自己的模型卡明确指出「100样本的试点是令人鼓舞的信号,而非保证」,并指出像Banking77这样有72个类别的冗长、含糊标签集是Julia-1目前的薄弱环节。

截至发布时,这些数字均未在Supersonic Labs自己的模型卡之外得到独立复现——在第三方验证之前,请将其视为厂商自报数据。

基准测试标签数得分来源
AG News494/100厂商自报
DAIR Emotion686/100厂商自报
MASSIVE(52个语言区域)意图集71.5%(110,573/154,648)厂商自报
Banking77(试点)7264/100 vs. 87%参考分数厂商试点,100个样本

应该本地运行Julia-1,还是调用Jev的云端API?

Jev由TypeSafe AI于September 15, 2026推出,是Julia-1本地方案的云端对应版本——而且获得了远超Julia-1的关注度。发布视频在X上获得了约40 million次观看,TypeSafe AI围绕发布获得了一轮由DCVC领投的$40 million种子轮融资,此后投资者曾以超过$10 billion的估值接触该公司,据彭博社的报道。

Jev由一位前OpenAI研究员打造,定位为「System 1」模型:它返回的是类型化、经过校准的决策,而非文本——用于路由、打分、分诊和审核,与Julia-1属于同一任务类别。与Julia-1不同,Jev仅通过DigitalOcean的Model Catalog等合作伙伴以云端API的形式提供。TypeSafe AI并未公布Jev的参数数量或模型架构;外部观察者仅是未经证实地猜测,它是基于开放权重底座的Transformer模型。

定价方式是按token计费,而非下载后免费使用:Jev每百万输入token收费$0.042,输出token目前免费,TypeSafe AI称在标准云端API条件下端到端延迟为70–500毫秒。目前尚无公开基准测试对Jev和Julia-1进行过正面比较——两者未在同一任务集上被评估过。

如需了解决策模型类别之外的纯CPU本地方案,请参阅适用于纯CPU设备的最佳Ollama模型。

常见问题

什么是「决策模型」,它与LLM有何不同?▾
决策模型接收一个上下文、一个问题和一份固定的候选答案列表,然后对其打分或选出一个——它从不生成开放式文本。通用LLM也能做到这一点,但每次调用还必须生成、格式化并解析文本回应,这会消耗更多token并增加延迟。Julia-1和Jev都是专门为这项更窄任务而构建的决策模型。
Julia-1能替代用于工单路由的LLM调用吗?▾
对于固定的一组路由类别来说,原则上可以——这正是Supersonic Labs构建它的用例。其自身的基准测试显示,在4标签主题分类(AG News)上准确率为94%,但在72标签的Banking77试点上只有64/100,因此准确率在很大程度上取决于你在多少个类别之间进行路由。在替换生产环境中的LLM调用之前,请先用你自己的类别列表进行测试。
Julia-1可以免费使用吗?▾
可以——它以Apache 2.0许可发布,因此你可以下载并运行它,无需按请求付费。你仍需支付自己的算力成本,但Julia-1不需要GPU,可在CPU上运行。
Jev能像Julia-1一样本地运行吗?▾
不能。Jev仅以云端API形式提供——通过DigitalOcean的Model Catalog等合作伙伴——TypeSafe AI并未发布其权重或架构。
使用Jev的费用是多少?▾
截至September 2026发布时,TypeSafe AI对Jev的定价为每百万输入token收费$0.042,输出token目前免费。
mmBERT-small是什么,它和Julia-1是同一个模型吗?▾
mmBERT-small是约翰斯·霍普金斯CLSP推出的140M参数多语言编码器,Julia-1正是基于它构建的,训练数据覆盖MIT许可下的1,800多种语言。Julia-1在其之上添加了一个决策打分头,是Supersonic Labs发布的一个独立的、采用Apache 2.0许可的版本,评测范围是52个语言区域,而非全部1,800多种语言。
Julia-1在实际任务中的准确率如何?▾
这因任务而异:在AG News上为94/100,在DAIR Emotion上为86/100,在MASSIVE的52个语言区域上为71.5%,在100样本的Banking77试点上为64/100,而参考分数为87%。所有这些数字均为Supersonic Labs的厂商自报数据,尚未经过独立复现。
有没有人在同一基准测试中直接比较过Julia-1和Jev?▾
截至目前尚无公开比较。两者来自不同厂商,针对同一「决策模型」类别,但尚未在共享的评测集上进行过正面测试。