Jev 读完自然语言,不生成回答、不做推理、不解释理由——它只返回带类型的答案和概率:一个选项、一个分数、一个是/否。
代码拿到就能用。不用写 prompt、不用写 parser、不用处理它把 JSON 套进 markdown 围栏。
拿生成式 LLM 做分类、路由、打分这类判断,会同时踩到五个坑。 它们不是「调参没调好」,是训练目标决定的——生成式模型被优化成「写出像样的文本」,不是「给出校准过的判断」。
prompt 发出去,接下来做的是和业务无关的事:从自由文本里捞那个结构化答案。模型某天多一句寒暄,parser 就炸。
提示词是一层约定,解析是第二层。任何一层漂移,整条链路静默失败——它不报错,它把拼错的 "techincal" 直接写进你的数据库。
规则写进 system prompt,等于把规则放在攻击者最熟练的位置。而且每个模型版本都在悄悄移动那条线——上周会被拒的回答,这周它答应了。
只要一个 0–2 的分数,它写了 372 个 token 的推理过程才给你这个数。慢,贵,贵在哪:你在为「它向你解释自己」付费。
让 LLM 输出一个 confidence 字段,它会给你一个很像样的数字。但这个数字从未和真实结果对齐过——它只是生成了一个「看起来像 0.87 的 0.87」。
没有校准过的概率,你就写不出 if confidence < 0.5。整个升级、复核、转人工机制,失去地基。
左边是通用生成式 LLM 的典型行为,右边是 Jev 返回的全部内容。 右边没有任何一句话是给人看的——它全部是给代码看的。
整个产品最反直觉的地方:表达能力被故意限制成三种形状。 形状固定,返回值才永远可解析;选择有限,概率才校准得出来。点左边切换。
概率是完整的分布。置信度是把分布压成一个 0–1 的数,让你能不写数学就做阈值判断。 拖动下面的滑块——同一批模型输出,会翻转出完全不同的行为。这就是「你的代码编码了你的风险承受度」。
文档的原则很简单:confidence < 0.5 是兜底,接住「模型自己都说不好」的; 往上,每个动作按后果分设阈值——查余额这种只读操作不用门槛,批准转账这种不可逆操作要。 阈值本身没有标准答案,必须拿你自己的数据跑出来。
这是最容易误解的一点。Jev 不会让 Agent 更聪明——它不规划、不写代码、不调工具。 它出现在 Agent 每一次循环的岔路口:在需要「是或否、往哪走、够不够格」的瞬间, 用 100 毫秒给一个可信的答案。点左边看每一站。
两个原因叠加。第一,单次判断是 70–500ms,不是秒级。 第二,也是更关键的:同一份文本上的多个问题,合并进一次请求,文本只发一遍。 官方那个 13 问的合规案例里,这一个动作带来 12.2× 成本、10× 时间的差距。拖滑块,看你自己的数字。
官方文档把这些归成 5 类、20 多个方向。下面每一条都出自文档原文, 最右一栏是数字——没有实测数据的我标了「文档定性」,不编。
知道边界比知道能力更重要。左栏是文档明确写的适用范围,右栏是明确的限制—— 其中很大一部分不是「暂时还没有」,是刻意的设计取舍。
窄而连贯的判断。一个问题只问一件事,答案可被代码直接消费。
同一份文本上并行问很多问题。加问题几乎不增加延迟,因为并行执行。
把不确定的部分显式暴露出来。概率和置信度是返回值,不是事后猜的。
大语料上的廉价打标。把文本变成可统计的标签,或喂给经典 ML 的特征。
校验别的 AI。查引用是否真的支撑了那句话、查抽取字段是不是编的。
嵌入到实时交互里。约 150ms 的决策,能放进一次点击和下一次渲染之间。
不写东西。不生成回复、不写代码、不解释理由。要文字就还得接 LLM。
只吃文本。字符串、JSON、文本数组。图片、音频、视频都不支持。
不能按你的数据微调。所有账户共享同一套权重,没有 LoRA、没有私有适配。
不是所有语言一样好。英文是主要训练语言,其他语言「能处理,但不等同」。
单次上下文 64k。其中 state 加最长那个问题合计 32k。
不保证单条答案正确。校准是在一批预测的尺度上度量的,单条仍可能错。
置信度≠工作流正确性。它衡量分布有多集中,不是你据此行动的许可。
三步:拿 key、装 SDK、发一次请求。下方是同一套东西的三个视角—— 你写的、模型看到的、返回给代码的。
在 console 申请 key 存到环境变量,SDK 会自己读。Python ≥ 3.10,或换成 JavaScript SDK。
三个问题放进同一个 dict。它们并行执行、互相看不到对方的答案,所以每个问题必须自带完整语义。问题名不进模型,只有 instructions 和 criteria 会被看到。
每个答案的类型由问题类型决定:Choice 给分布,Score 给位置,Noul 给概率。用置信度把不确定的拦下来。
"Here is some text."
→
"Here is a decision
your code can use."