面向Google编程CHARLES ZHANG

AI DAILY / 2026-09-19

Jev 发布两天内涌现的 6 个社区克隆

[AINews] Here are 6 Clones of Jev in 2 days

Agent 开发Latent Space · 2026-09-19

全文中文翻译 · AI 生成,仅供学习交流

[AINews] 两天内冒出的 6 个 Jev 克隆

大型编码器加上两个新增的 transformer 层,用来给用户给定的选项打分;用 PPO(近端策略优化)跑在序列嵌入上,输出逐轮的转化轨迹(概率从 0.0 到 1.0)。

对没能获得关注愤愤不平。声称 RLCD 的无理由置信度是基于熵的、没有校准。DiffusionGemmaJev:从扩散模型(Diffusion Model)的角度切入处理这个问题。

基准上相当接近。Bespoke Nimble,在 Qwen3.5-9B 上做 LoRA(低秩适配)微调,用对比式数据筛选(contrastive data curation)。(基准成绩接近但略低)SemIf(前身 OpenJev)(HF),4B 和 35B 的因果 Qwen3.5 为主干,最后一个 token 上接一个小型三分类 NLI(自然语言推理)分类器。

对比 Laya 的 Jevlike,40K 字节嵌入的轻量级选项-注意力模型。每个候选项变成一条 query,从共享的上下文表征里读取信息,然后拿一个分数。

Kev-0.5B,在 Qwen2.5-0.5B 之上加一个 LoRA 适配器和一个小型读出头(readout head)。

当然,关于数据这一面讨论得还远远不够,而大家也承认数据是 100% 合成的。

AI News for 9/17/2026-9/18/2026. We checked 12 subreddits, 544 Twitters and no further Discords.

AINews 的网站可以搜索所有往期。提醒一下,AINews 现在是 Latent Space 下面的一个栏目。邮件订阅频率可以自己开关。

AI Twitter Recap

决策模型、路由与「Jev」浪潮

判别式模型(discriminative model)作为一种新的系统原语脱颖而出。

最热闹的技术讨论围绕 Jev 展开,一个非生成式的决策模型,被定位成 LLM 的快速「System 1」补充(译注:卡尼曼双系统理论中的系统 1,指快速直觉式思考)。

@ankrgyl 说它现在作为 eval 模型在 Braintrust 里可用,相较此前的方案打分成本约低 400 倍。@gabepereyra 强调的是校准概率(calibrated probability)的用例,比如路由、引用选择、升级处理、法律运营决策。

更偏架构的看法来自 @hxiao。他认为 Jev 可以把工具调用、路由、MCP(Model Context Protocol)风格的决策,从小生成式 LM 手里拽回到判别式模型上。@signulll 更进一步,把这一类模型定位成近乎零边际成本、设备端可跑的判断层,拿来做通知、UI 适配、传感器驱动的决策。

开源复现和生态克隆立刻涌现。

@madiator 放出了 Bespoke Nimble,一份「open Jev」的配方,用 LoRA 微调 Qwen3.5-9B,搭配合成对比数据筛选和受限解码。在他们整理的 eval 上,基础 Qwen 从 66% 提到了 90%,Jev 是 93%,H100 上报告 100ms,能本地跑。

尺寸更小那头,@jaredpalmer 放出了 Kev-0.5B,一个基于 Qwen2.5-0.5B 的迷你 Jev-like 模型,MacBook Pro 就能跑。

反应大致按老资历来分。@MParakhin 提到 ChatGPT 之后入行的用户像看到了新大陆,而 GPT 之前就做 ML 的人对这波热度更困惑。@abacaj 提的那个问题是点到位的。很多 demo 强调的是速度而不是质量,这个品类至今还没有标准基准。

第一批像样的集成落地在浏览器和 computer-use 工作流里。

@levie 演示了 Jev 把 Box 的事故报告分类到升级路径。@ndrezn 展示了用 LangChain + Jev 做浏览器使用,在维基百科游戏和「叠衣服」这种结构化工作流上表现很强。@cline 上线了一个插件,让 Jev 在 Cline 里获得浏览器能力。

@hwchase17 直接说浏览器使用是他目前见过最好的 Jev 应用。

总结一下,这看起来更像一个工作流控制面的故事,而不是聊天机器人的故事。

Agent 工具、编码 harness 与 Claude Code 标准

AGENTS.md 作为一个跨工具约定真正获得了势头。

这里最高信号的产品更新是 @trq212 宣布的。Claude Code v2.1.277 现在在没有 CLAUDE.md 时会检查 AGENTS.md,配置层也加了开关。这相当于默认承认 AGENTS.md 是一个正在成型的标准,而不是某个工具的私有约定。

@simonw 立刻指出了实际好处。少写一堆一个格式指向另一个格式的 shim 文件。

harness 设计正在成为编码 agent 性能和成本的一等变量。

@pidotdev 拎出了 Harness Tax 那篇分析。一个简单的工具集(read、write、edit、bash)就能在基准性能上摸到 Pareto 前沿,同时砍掉不必要的开销。

相关地,@_akhaliq 指向论文《An Empirical Study of Harness Design for Coding Agents》,强调基准结果越来越多地由 harness 结构、上下文配置、轮次预算、工具能力决定,而不光是基础模型。

这跟 @dexhorthy 的「软件工厂」论点是一致的。团队仍然需要读代码,有意识地设计人和 agent 的接口。

软件系统里的模型选择正在分化。

几位从业者描述了一种「规划用前沿、执行用便宜」的分裂。@TheAhmadOsman 把他的栈总结成,规划用 GPT 5.6 Sol XHigh,实现用 GLM 5.3 Flash,其他任务用 DeepSeek V4.1 Flash。

@kylebrussell 报告了一个内部知识库流水线,从 Opus 一路换到 Sonnet,再到 GLM 5.2,再到 GLM 5.3 Flash,开春以来砍掉了大约两个数量级的开销。

与此同时,@theo 主张在真实编码里,像 Fable 和 Astra 这种更强模型的回报不只是代码质量,而是执行和迭代上更微妙的效率提升。

基准、递归自我改进与数学能力

关于 RSI 的讨论更精确地区分了什么才算「递归」。

@TheTuringPost 给了一个有用的分类法。AI 改进代码或训练方法本身,如果外围的改进循环还固定着,并不算完整的递归。真正的门槛是 AI 不只能改模型内部,还能改搜索策略、经验生成、研究工具和改进流程本身。

这个框架跟 @HuaxiuYaoML 的 RSI-Exam 更新很搭。GPT-6-astra 还是第一,0.5126。Fable 5.1 以 0.4813 首次进入第二,还没有模型摸到前沿校准的参考线。

数学基准继续被前沿模型拿下,但解读上仍有细微差别。

@EpochAIResearch 报告说又一道 FrontierMath 的开放问题在与 GPT-6 Astra 的交互会话中被解出。

另外,@SAIRfoundation 启动了 Open Math Model,主打开放模型和数学工具,由研究社区共同塑造。

针对「可验证性解释了数学强」这个说法,@steve47285 转述了一个论点。预训练数据、而不仅仅是可验证的奖励结构,才是 LLM 数学和编码能力这么强的根本原因。

@sarahcat21 那条元层面的观点值得记住。我们不光需要更好的基准,还需要更好的基准维护和审计工具。

computer-use 基准离饱和还远得很。

@ValsAI 发布了 CUA-Bench,跨 6 款游戏(其中 3 款私有)测试实时的键鼠操作,作为「对人容易、对模型难」的代理任务。

@ValsAI 后续的数字说明这事儿真的难。所有前沿模型都在 20% 以下。

与此同时,@trycua 开源了 CUA-S1-FORMS,这是「System One」小型 computer-use 模型家族的第一款。

方向值得一说。实时动作循环、视频驱动的适配、持续学习,不只是纯文本的规划。

基础设施、训练系统与模型架构

长上下文与大规模训练基础设施仍然是活跃的优化战场。

@Azaliamirh 放出了 Turbo-dLLM,一个用于大规模训练扩散 LLM 的开源库,报告在 8 张 H100 上 512K 上下文提速 2.48 倍、1M 上下文提速 7.59 倍,用的是 Context-Sharded Block Parallelism。

这跟从业者对百万 token 区段的关注是吻合的。@andrew_n_carr 指出 DeepSeek V4.1 Flash 在上下文扩展到 1M token 后质量显著提升,认为 agent 是吃上下文的。

架构分类的争论还在。

@ahatamiz1 认为这个领域把 SSM 这个标签用得太滥,任何线性模型都被叫 SSM。他提议用 linear RNN 作为总称,SSM 作为一个子家族,把 Mamba2 和 GDN 一族区分开,理由是 GDN 表现得更像是对一个局部回归损失做梯度步,而不是一个离散化的 ODE。

对于追踪 transformer 之外序列模型方案的工程师来说,这种术语清理有用,不只是咬文嚼字。

端侧/本地的神经程序执行也有值得关注的进展。

@yuntiandeng 描述了 ProgramAsWeights。开发者用英语描述一个 AI 函数,一次编译后,就能在 CPU 上、Wi-Fi 关掉的情况下本地跑一个小神经网络程序。代码和模型都开源了。

这跟 Jev 那个话题挨得挺近。都指向更小、更专门、可本地跑的推理产物,而不是越来越大、什么都能聊的通用模型。

机器人、视觉、音频与生成式媒体

开放的机器人数据发布难得这么有内容。

@adamrasb 宣布了 ABC 的完整版本,包括代码、24 个任务上的 400+ 小时仿真数据,以及 5,850 条带标签的策略评估片段。

在一篇更详细的配套文章里,@redstone_hong 把 ABC-130K 描述成迄今最大的开源遥操作数据集。3,500 小时、130K+ 片段、195 个任务,在一套 $8K 的双手硬件上采集,硬件、训练代码、仿真和评测全部开源。

基线科学包括 sim-to-real 相关性 r = 0.91(任务进度),以及离线指标、缩放律和条件化的研究。

Astra 在评测和产品里频繁出现,尤其在视觉上。

@skalskip92 报告 GPT-6 Astra 是 Roboflow 测试过的最强的视觉模型,覆盖检测、分割、框提示、计数、推理和视频。

取舍仍然明显。「高算力」档把检测的 mAP@50 从 82.1% 提到 83.6%,但每张图的费用大约从 $0.050 翻到 $0.101,延迟从 11s 涨到 32s(详情)。Roboflow 也把 Astra 接进了 Auto Annotate。

语音和唇形同步出了一批基准过硬的新东西。

@ArtificialAnlys 报告 Grok Voice Transcribe 2.0 在语音结束后 0.49s 的流式最终转写上达到 2.7% WER,相比上一代的 3.9% 有改进,流式定价保持 $0.20/小时,非流式 $0.10/小时。

视频这边,@fal 发布了 H3 Max Lip Sync,在自家评测里号称速度和双双第一,中位生成时间 11s。@isidentical 说这个模型是把扩散 RL 推进一个可验证的唇形同步任务里训出来的。

AI 安全、评估治理与安全

Anthropic 把评估能力内嵌的策略变得更具体,也更引发争议。

@AnthropicAI 宣布与 Accenture 合作,对前沿 AI 做独立评估,两家机构预计五年内投入至少 $1B 来建设能力。

这呼应了更广的呼声,把第三方评估方嵌进去,给到员工级别的访问权限。

反应从有保留到敌意不等。批评者质疑咨询公司是不是做模型红队和安全护栏评估的合适载体。@TransluceAI 强调,独立性和有意义的监督条件才是真正的问题。

「流氓 agent」/Hugging Face 事件继续引发关于隔离的争论。

@polynoamial 澄清说,他那条被群嘲的思想实验说的是所谓隔离 agent 之间的协作,不是通过热传感器偷权重。他认为 HF 事件给出的教训是,别把沙箱隔离当成唯一的防线。

@martin_casado 给出了最强有力的「替对方说句公道话」。跨气隙的隐蔽信道不是新东西,吞吐量可以非常小,真正的要点是分层防御而不是耸人听闻。

与此同时,@WSJ 和 @jeffjarvis 整体上反对「流氓 AI」的叙事,认为这些事件归根结底还是人在系统里配置出来的、做了人让它做的事。

围绕安全法和运营问责的政策压力正在积聚。

@TheRundownAI 报道,加州州长 Gavin Newsom 签署了一项行政令,召集一个专家组来建议更严的 AI 安全法律,包括可能