AI DAILY / 2026-09-22
Jev决策模型详解:黑箱回归与适用边界
Jev introduces a new shape of LLM - System One, aka Decision Models
中文翻译 · AI 生成,仅供学习交流
Jev 引入了一种新形态的 LLM,System One,也叫决策模型
上周,TypeSafe AI 亮出了 Jev,这是所谓「System One 模型」(System One models)这一全新模型类别的首个实例(我也站 Maggie Appleton,觉得「决策模型」(decision models)这个名字更贴切)。
Jev 是对常见 LLM 形态的一种有趣变体。它仍然接收文本输入,但返回的不是文本,而是浮点数,对应分类、是/否问题、评分(rating),以及相应的置信度分数。
TypeSafe 是这样描述 Jev 的,把它想象成一次前沿智能的函数调用(function call)。非结构化的状态进去,类型化的概率决策出来。它还跑得飞快,定价也便宜。普通 LLM 按输入和输出 token 计费,通常输出端收费明显更高。Jev 只对输入收费,输出免费。它的首个模型输入价格为每百万 token 0.042 美元,比 OpenAI 的 GPT-5 Nano(每百万 0.05 美元)还便宜。
Jev 可以让你针对文本或半结构化数据提问。你要先组装一个「状态」(state)对象,里面装一个字符串、字符串数组,或者一组键值对。它可以描述一篇文章、一位客户,或任何其他类型的记录。然后你把它连同一个或多个问题发给他们的 API,每个问题都会得到一个回复。
你可以问三类问题。是/否问题,Jev 称之为「Noul」问题,他们的 CEO 在 Hacker News 上确认这个名字是 Bernoulli(伯努利)的缩写,源自伯努利分布(Bernoulli distribution)。你给出一条陈述,模型返回 0 到 1 之间的浮点数,表示它对该陈述为真的置信程度。选择题(Choice questions),模型从一组给定选项中挑出一个,实际上返回一个置信分数加上跨所有选项的概率分布。评分题(Score questions),你提供一串带描述的数值等级,模型返回该范围内的浮点数作为评分。
Jev 的 API 能接受单个文档(「state」),加上塞进上下文窗口(context window)的任意多个问题。问题会并行评估,所以问很多个问题花的时间跟只问一个差不多。
我觉得「决策模型」这个说法对理解该在哪儿用 Jev 很有帮助。它特别适合那些能写成分类任务(classification task)的活儿。比如垃圾邮件检测、推荐标签、优先级排序、相关性排名。我自己也在试,把它用在搜索结果的重排序(reranking)上。先用 BM25 这种廉价算法拉出 100 条候选,再用 Jev 针对原始查询给这 100 个候选打分。
黑箱又回潮了
Jev 有一点让我不太舒服。它在很大程度上代表着向黑箱机器学习系统(black box machine learning systems)的又一次回归。LLM 本来就已经是黑箱了。你可以要求它们为自己的决策给出解释,但你没法保证它们说的内容是有用或准确的。Jev 连这一步都省了。不管你喂进去多少文本,能拿到的回复就只有一个浮点数。
如果 Jev 把某条内容标为垃圾邮件,是哪些内容信号触发了它的判断?这也意味着偏见(bias)的问题必须摆在最显眼的位置。真心希望别有人拿 Jev 来给求职者排序。那个浮点数背后可能藏着模型里固化下来的各种潜在偏见,想靠实验把这些偏见拆开来看,会很棘手。
(我做过一个实验,让 Jev 对旧金山湾区每座城市用一个是/否问题打分,判断它们是不是「好城市」。结果 Cupertino 排第一,East Palo Alto 垫底。嗯。)
所以,评估(evals)和结构化实验比在普通 LLM 项目里还要更重要。所幸 Jev 便宜得很,跑上几百甚至几千条实验提示的成本也就几美分。
Jev 的非典型用法
过去几天,看着社区里冒出各种 Jev 的潜在用例,真的挺有意思。以下是几个我觉得颇具创意的例子:
- jevchat,Kyle Pena 所作,把 Jev 变成了一个(很糟糕的)聊天模型。每一步它只问 Jev 一个问题:「给定用户的问题和当前已经写好的回复,下一个符号(symbol)该是哪个?」
- Hacker News 上的 ericpruitt:「这是数字版的 Morty 戴着死亡水晶说话。」(译注:《瑞克和莫蒂》典故里,Morty 戴上了一块死亡水晶,所有人只能说真话。此处形容 Jev 只能输出冷冰冰的概率数字,差不多等于「被强制说真话」的数字化版本。)
- jev-leftpad,Fatih Kadir Akın 所作。用一句提示「在 value 之前需要多少个空格才能达到 targetLength?」,搭配一个允许从「需要 0 个空格」到「需要 10 个空格」中选择的选择题,硬生生实现了 left-pad 功能。
- jev-2048,Andy Gayton 所作,使用 Jev 来玩 2048 滑块拼图游戏。
开源权重的复刻
围绕 Jev,还冒出一批项目,想基于开源权重模型(open weight models)复刻同类模型。Kev 是个有趣的例子,基于 Qwen 3.5 做出了 8 亿、40 亿和 90 亿参数的版本。这里附上 Hacker News 上的讨论帖,有人贴了一个已经冒头的 JevBench 基准测试,专门用来比较「Jev 类决策模型」。
Jev 发布到现在还不到一周,围绕它的活跃度已经相当惊人。
Tags: ai, generative-ai, llms