跳到主要内容
赞助推荐 搬瓦工怎么选:三网直连 CN2 GIA-E
架构设计

Jev 的 8 个作弊级用法:AI 开始替软件做决定

15 分钟阅读阅读(8)
赞助推荐 团队协作里的 AI 办公工作台

过去两年,AI 产品大多在争夺同一个入口:聊天框。你提问,模型思考,然后给出一段文字、一份代码或一张图片。Jev 展示的却是另一条路线:它不试图成为更健谈的助手,而是把自己压缩成一个极快、极便宜、可批量调用的判断器。它接收结构化问题、判断标准和上下文,返回一个选择或概率。看起来比聊天朴素得多,放进真实软件后却可能更有用。

Matthew Berman 在视频《8 Jev Use Cases That Feel Like Cheating》中演示了八类应用:识别 AI 内容、清理网页、自动化工作流、邮件排序、语义页内搜索、动态拼装 UI、长视频切片,以及颜色和 emoji 匹配。单看任何一个都不算魔法。更值得 AI 从业者留意的是它们的共同结构:任务无需创作新内容,只要从有限候选中迅速做出大量选择。速度、成本和并发在这里已经属于产品能力,而非一组放在发布会幻灯片里的性能参数。

赞助推荐 一人公司 · 创业装备库
赞助推荐 一人公司 · 创业装备库

从生成器切换到判断器

我们已经习惯用“它能生成什么”来衡量模型:能不能写得更长、画得更真、完成更复杂的代码。Jev 的思路几乎反过来。你先把问题变成清晰的决策空间,再让模型判断哪个结果更符合标准。

视频用“热狗是不是三明治”做了一个故意有点滑稽的例子。输入是一组 JSON 结构,包含问题、正反两面的定义和相关概念的解释。模型最后给出 73% 的“是”。重点当然不在热狗。这个例子暴露了 Jev 的使用契约:产品方要先定义判断边界,模型负责在边界内高速归类。

这和通用大模型的聊天体验有明显区别。面对“我该怎样和老板谈加薪”这种开放问题,Jev 并不合适;让它从零写一套复杂代码,也不是它的长项。但如果问题变成“这封邮件是否需要我今天回复”“页面上的这个节点是不是广告”“这段 transcript 是否对应用户想找的主题”,它就进入了舒适区。

我认为,这种能力最容易被低估,因为“做选择”听起来没有“生成作品”那么惊艳。可软件的大部分运行时间,本来就在做选择:是否展示、排在第几、走哪条分支、调用哪个组件、触发什么动作。传统系统靠人工规则覆盖这些分支,规则一多便互相打架;通用大模型能理解语义,却往往太慢、太贵。Jev 瞄准的正是两者之间长期存在的空隙。

八个案例,其实只有三种产品原型

视频列了八个用法。与其逐项复述,不如把它们归成三类。这样更容易看出哪些只是有趣的 demo,哪些可能长成稳定产品。

第一类:给信息流加一层语义过滤

AI slop 检测器、网页广告与干扰元素清理、邮件优先级排序,都在做同一件事:对不断涌来的对象打标签,再据此隐藏、保留或排序。

传统过滤器依赖关键词、选择器、黑名单和手写规则。它们速度快,也容易解释,但遇到换一种表达、改一个 DOM 结构、换一套营销话术就会失效。通用模型能看懂“这块内容是否在诱导我订阅”,可是如果每加载一个网页都要等待几秒并支付一笔不可忽略的推理费用,产品体验很快就崩了。

视频中的 Unclutter 浏览器工具很能说明问题。页面加载后,它把元素连同判断标准交给 Jev,识别广告、cookie 横幅、加购提示和无意义弹窗,再把对应节点移除。用户不会看到模型长篇回答,只会发现网页忽然安静了。对这类功能来说,模型不露面反倒是最好的体验。

邮件排序也是如此。按时间倒序只是邮箱客户端的默认规则,不等于人的真实优先级。来自关键客户的旧邮件,可能比半分钟前收到的促销邮件重要得多。视频演示的方案能在不到半秒内给 100 封邮件排序。语义判断快到这个程度,就能成为界面的默认行为。用户不用再点一个“AI 分析”按钮,然后盯着加载动画等待。比起准确率多几个百分点,这种体验变化更直观。

不过,过滤类产品有一个不能回避的问题:误判的代价不对称。误删广告也许无所谓,误隐藏账单提醒却很麻烦。产品设计不能只给一个“AI 已清理”的结果,还应保留撤销、查看被过滤内容和调整标准的入口。模型可以替人做第一轮筛选,不该悄悄抹掉人的复核权。

第二类:把模糊意图映射到已有对象

语义版页内搜索、动态 UI、长视频切片,以及颜色与 emoji 匹配,都可以抽象为“从候选集合里挑东西”。候选集合可能是网页段落、设计组件、视频时间片,也可能是一组色值。

这类任务特别适合高速判断模型,因为输出空间已经被产品方控制住了。视频中的动态网页并非让 Jev 临场写 HTML 和 CSS,而是让它从按钮、输入框、字体、布局模块等现成组件里选择并组合。这样做牺牲了一部分无限生成的自由,换来的却是稳定性:组件经过测试,视觉规则预先确定,模型只决定此刻该用哪些。

这对 AI 产品设计是很重要的提醒。许多团队把“端到端生成”当成终点,仿佛模型直接吐出成品才算先进。实际交付中,约束往往比自由更值钱。让模型生成任意前端代码,可能出现样式漂移、无障碍缺失、状态处理错误;让模型从可信组件库里挑选,结果虽然没那么炫,却更快、更便宜,也更容易上线。

Clipfast 的视频切片演示同样如此。一个 90 多分钟的视频,用户输入想找的内容,系统在两秒内找出相关片段。这里不需要模型重新“创作”视频。它只需在 transcript 和时间轴上判断哪些区间最匹配意图。过去语义检索也能完成这件事,但当延迟降到近乎即时,剪辑工作流就发生了变化:用户可以连续尝试多个表述,把搜索当成编辑动作,而不是提交一次耗时任务。

颜色和 emoji 的案例看起来更像玩具,却揭示了同一机制。输入“80 年代迪斯科”“蓝屏死机”或“我要减肥”,模型从既有色板或 emoji 池中挑出关联项。它们未必值得单独做成公司,却很适合成为设计工具、聊天产品和内容编辑器里的微能力。大量 AI 价值,可能就藏在这种不配拥有独立聊天框的小功能里。

第三类:在自动化链路中充当路由器

Zapier 的案例最接近企业场景。工作流平台原本擅长连接事件与动作:收到表单后写入表格,新建订单后发送通知。麻烦在于中间的判断通常要靠固定条件。如果邀请来自某类客户就接受,如果标题包含某个词就转交某人,规则很快变成一团难维护的条件树。

把 Jev 放在链路中间,相当于增加一个理解自然语言标准的路由器。比如,每当收到日历邀请,让模型依据参与者、主题、时间冲突和个人偏好判断接受或拒绝。再把同样思路扩展到工单分发、线索评分、内容审核和异常告警,组合空间确实很大。

但自动化比搜索和推荐更危险,因为判断之后会立即产生外部动作。一个排序错误只让列表不够理想,一个自动拒绝会议的错误却可能损伤关系。稳妥的上线方式应当分阶段:先只给建议并记录结果,再比较模型建议与人工选择;确认边界后,只自动处理低风险、高置信度案例;最后才考虑扩大权限。速度很诱人,权限设计却必须慢一点。

为什么“快”会改变产品,而不只是改善指标

视频多次强调 Jev 可以在极短时间内完成成百上千次判断,价格也非常低。按视频给出的说法,输入为每百万 token 4.2 美分,输出免费。价格与正式条款仍应以服务方最新页面为准,但它呈现的方向很清楚:判断型推理正在被压到接近基础设施的成本区间。

当一次推理需要十秒,产品会把它包装成一个显眼功能,让用户主动点击,并用加载动画解释等待。当一次推理只需几十毫秒,产品可以把它藏进鼠标移动、页面加载、列表刷新和每条消息到达的瞬间。前者是“使用 AI”,后者只是软件变得更懂你。

延迟还会改变交互频率。语义搜索若要等五秒,用户会认真组织一次查询;如果立即返回,用户会边看边改,连续试十次。动态 UI 若需要等待生成,只适合首次创建页面;如果几乎瞬时,它可以根据每次意图变化重新拼装。成本也一样。单次调用便宜并不只意味着省预算,它允许团队把一个大判断拆成许多小判断,为每个页面节点、每封邮件、每个视频片段分别决策。

这就是视频标题中“像作弊一样”的来源。所谓作弊感,并非模型突然拥有新的知识,而是旧能力跨过了可用性阈值。语义分类、相关性判断、候选排序早已存在;当吞吐、延迟和价格同时下降,它们才从后台批处理变成实时产品材料。

真正的门槛移到了问题定义

Jev 越快,越能暴露产品方的问题。如果你无法清楚描述“重要邮件”的标准,模型只能替你放大含糊;如果“广告”和“有用推荐”的边界没有定义,网页清理工具就会时好时坏。判断模型没有消除规则,只是把规则从代码条件改写成语义标准。

这项工作比写一句 prompt 麻烦。团队需要明确正例、反例和灰区,知道哪类错误更昂贵,并决定低置信度时怎么办。视频里的热狗示例能够工作,靠的是输入中的“结构性淀粉”“包裹馅料”等判定依据,并非模型凭空懂得更多。对于生产系统,这些依据还要经过真实数据验证。

一个可行的评估集至少应包括四部分:常见正常样本、容易混淆的边界样本、故意对抗规则的样本,以及业务上代价最高的少数案例。离线准确率只是一层。上线后还要记录模型判断、置信度、最终动作和人工纠正,才能知道系统究竟在减少工作,还是把错误悄悄藏起来。

解释也很重要,但不必强迫模型每次写一篇小作文。对网页元素,指出触发判断的文本或属性即可;对邮件排序,给出一两个主要因素;对自动化动作,保留输入、规则版本和结果日志。判断系统的可审计性来自证据链,不来自流畅的解释文案。

它不会取代大模型,更像给大模型做“控制面”

视频把 Jev 和一个更慢、更强的模型放进限时棋局作比喻:没有时间限制时,强模型可能获胜;有严格时间限制时,快速模型反而占优。这个比喻不必按字面理解,却很适合用来设计多模型系统。

未来的 AI 应用很可能不会只押一个模型。快速判断器负责筛选、路由、排序和决定是否升级;更强的生成模型只处理少量复杂案例。例如,客服系统可以先判断意图、风险和紧急度,普通问题走知识库,高风险投诉交给强模型起草并由人工审核。代码代理也可以用判断器挑选工具、筛掉无关文件、评估测试结果,再把真正需要推理的部分交给昂贵模型。

这种分工的好处不只是降低费用。它缩短关键路径,也把系统行为拆成更容易测试的模块。坏处是复杂度从一个 prompt 转移到了架构:模型之间如何传递置信度,判断错误如何恢复,规则版本如何管理,日志怎样追踪。团队若只看到低价调用,很容易低估这些工程成本。

我更愿意把 Jev 看作 AI 应用里的控制面,而非另一个万能大脑。它决定接下来走哪里,真正的内容生成、工具执行和高风险决策仍由其他模块承担。这个定位没有“全能智能”那么性感,却更接近成熟软件的实际需求。

AI 从业者现在值得做的三个实验

第一,翻一遍现有产品里所有条件判断。重点找那些已经堆出大量 if/else、用户经常手动调整、又需要理解文本或上下文的地方。不要先问“哪里能加 AI”,而要问“哪里因为规则写不完,只能让用户忍受笨拙默认值”。邮件、通知、搜索、审核、工单和界面推荐通常会先浮出来。

第二,把候选空间收窄。给模型一组可靠的动作、组件或标签,通常比允许它任意生成结果更稳。候选越清楚,系统越容易评估,也越容易回滚。动态 UI 的正确起点不是“让模型写整个网站”,而是准备一套经过设计和测试的积木,让模型负责选。

第三,为错误设计退路。过滤必须能恢复,排序必须能纠正,自动动作要有风险阈值和日志。可以先运行在 shadow mode:模型照常判断,但不真正执行,只与人工结果对比。等数据证明它在目标场景可靠,再逐步开放权限。任何声称“近乎免费”的推理,如果能在一秒内犯一万次错误,依然会很贵。

最后:下一波 AI 产品可能没有聊天框

这段十分钟的视频让一种产品形态变得很具体。八个新鲜 demo 只是表面,背后共同的思路是:模型无须承担完整任务,也无须向用户展示长答案。它可以只做一个极小的语义决定,然后立刻消失在流程里。

如果只能记住一件事,我会记住这句:当判断足够快、足够便宜时,语义理解会从“功能”变成软件的默认层。网页知道哪些东西在打扰你,邮箱知道什么应先处理,编辑器知道你想找哪一段,界面知道此刻该出现什么组件。用户未必意识到背后调用了模型,只会觉得软件少让自己做了几次无聊选择。

Jev 最终能否兑现视频里的兴奋,还要经过真实场景中的准确率、稳定性和安全性检验。宣传中的价格也可能变化。但它指向的设计原则已经足够清晰:不要让最强模型处理每件事,也不要把所有 AI 都塞进聊天框。先把问题拆成大量可验证的小决定,再为不同决定选择刚好够用的智能。很多产品缺的或许不是更会说话的助手。一个安静、迅速、知道何时该走哪条路的判断层,反倒更实用。


视频来源:Matthew Berman, 8 Jev Use Cases That Feel Like Cheating。文中产品表现与价格信息来自视频演示,实际使用前请以对应服务的最新文档与条款为准。

赞助推荐 一键部署 AI 大模型
赞助推荐 一键部署 AI 大模型
赞(0)
未经允许不得转载:80aj » Jev 的 8 个作弊级用法:AI 开始替软件做决定
赞助推荐 低成本上手 Claude Code 的中转选择
赞助推荐 低成本上手 Claude Code 的中转选择
赞助推荐 一键部署 AI 大模型
赞助推荐 一键部署 AI 大模型