← 返回资讯热点
AI热点雷峰网发布时间:2026-09-20 23:47热度 202.0000

深度解读:关于 Jev 的几大疑问

刷屏全网的 Jev,是 AI 革命,还是营销噱头? 作者丨 高允毅 编辑丨岑 峰 这几天,全网都被 Jev 刷屏。 说它是这周最火的大模型,一点也不夸张。推特上诸多大佬用它打马里奥,过滤垃圾信息,数字货币相关业务,称它为“Agent时代的系统1”;也有人说这就是一个 JSON 分类器,值得吹? 有人说它比 DeepSeek 还快,做同一个任务,28 秒 Jev 已经刷完 428 条数据,完成打标签和分类,DeepSeek V4.1-Flash 才做到第 6 条。 有人已经开始思考,这种判断速度放进自动驾驶场景,能不能更上一层楼。还有人在实测中,摸到了它的使用边界。 可能是天下苦 LLM “慢思考”久矣,让 Jev 的“快思考”在这个节点火爆全球 —— Jev的技术路线,与苦苦钻研o1这种“慢思考”、能写长篇大论的深度推理模型可谓“反其道而行之”,只做一件事:决策判断。这就好比,大家都在培养一个全能作家,TypeSafe AI偏偏弄了一个只能打分的裁判。 这到底是什么?吹的成分大,还是今年的最大创新路线?目前众说纷纭。 我们综合了官网技术报告和业界的深度解读,把它摊开来看。 01 Jev 是什么?来自官网的解释 Jev 是 ChatGPT 早期核心贡献者之一 、RLHF 之父 Diogo Almeida 创立 TypeSafe AI后,闭关两年的开山之作。它与以往的模型很不同的点是, 它不生成文本 。 它接收非结构化输入或问题,返回带类型的概率决策,代码可直接依据结果执行动作。简单理解, 这是一个“自动判断器”,你给它输入一些内容,它还你一个“决策结果”。 它只做三件事,bool、choice、score,bool 是 yes 或者 no 判断,choice 是做选择,score 是打分。 所以,Jev 最大的特点就是 “极速”与“极省” 。官网介绍,它比普通 LLM 快 20-200 倍,成本低近两个数量级,输出 Token 免费。 这种快,来自于新的模型架构、并行采样器以及一种全新训练方法 “校准决策强化学习(RLCD) ” 。其中,最值得注意的,他现在选择 RLCD,是出于对他当年创造的 RLHF 的反思。 当年, GPT-3 还只会文字接龙,RLHF 就是基于人类的反馈诞生的强化学习,它让 AI 的表达与人类偏好对齐,从而催生了 ChatGPT。 但随着 RLHF 被大规模使用,人们发现大模型开始为了讨好人类瞎回答,尤其是面对那些人类都无法理解、无法打分的复杂问题时,RLHF 会“不懂装懂”。 于是,可验证奖励的强化学习(RLVR ) 诞生了,它基于客观的编译器或数学验算程序的反馈,对就是对,错就是错,直接开启了 OpenAI o1/o3、DeepSeek-R1 为代表的“大模型深度推理时代”。 但为了追求“正确”,模型的深度思考,让生成答案变得非常慢、极其消耗算

来源:雷峰网
说明:本站展示中文整理摘要,便于快速阅读;完整内容和版权归原站所有。