Jev是什么?TypeSafe AI的决策模型解释
一分钟了解 Jev:AI 决策,而非另一个聊天机器人
一位客户说他们的订阅续订出现了两次,并要求退款。您的支持应用程序需要一个部门和一个退款请求标志,而不是一篇文章。TypeSafe AI 的 Jev 是一个决策模型,它解释提供的信息并从您定义的集合中返回答案。它在应用程序内工作,而不是作为自主支持代理。

想象一个分类台,配有预定义的部门托盘和一张评级卡。Jev 选择一个托盘,根据描述的级别对消息进行评级,并返回概率以及其判断。它不撰写回复或编写代码。该分类台仍然可能将消息放在错误的托盘中:限制可能的答案并不能使每个答案都正确。您的应用程序控制下一步,包括人工审查。
TypeSafe 在 2026 年 9 月 15 日宣布 Jev 进入公开早期访问。其推出通过提议 AI 的不同位置而引起关注:日常软件决策而非另一个聊天窗口。评估该承诺意味着将有用的工作负载与头条数字分开——以及从托管 Jev 本身中托管您的应用程序。
Jev 与 LLM 的区别——以及与普通规则的区别
代码可以检查交易是否结算或账户是否有权限。解释”请退回多余的付款”需要语义判断:理解意思而不是检查确切的条件。大型语言模型 (LLM) 可以生成文本、代码和结构化响应,包括分类。Jev 专注于诸如哪个部门应该接收消息这样的问题。其类型化输出使用约定的答案类型和允许的值。这固定了标签的形式,而不是它是否符合消息。
例如:客户写道,”你向我收费两次。请退回多余的付款。”代码检查是否结算了两笔费用。Jev 可以从允许的部门(计费、技术或账户)将消息路由到计费。LLM 可以起草回复。

| 方法 | 主要工作 | 输出 | 最佳适用 |
|---|---|---|---|
| 普通规则 | 评估明确陈述的条件,不解释意图 | 计算值或预定义的代码分支 | 算术、权限和已知业务逻辑 |
| 生成式 LLM | 写作和灵活推理;也包括分类 | 生成的文本或模式约束的结构化结果 | 开放式任务、起草、代码生成和扩展推理 |
| Jev | 使用允许答案的描述解释提供的信息 | 选择、分数或是概率 | 重复的判断,其中可能的答案可以提前定义 |
现代 LLM 可以分类并遵守支持的输出模式。传统的任务特定分类器已经处理许多固定标签的工作。Jev 的主张是专业化和可用自然语言配置的问题,而不是分类的发明或结构化答案的独占所有权。你用词语描述判断,而不是为每个新问题训练单独的分类器。
TypeSafe 将此称为”系统一”模型,灵感来自快速、直观的判断。这是其术语,不是独立的科学类别或人类认知的证据。TypeSafe 表示其训练方法”校准决策强化学习”(RLCD) 旨在使分配的概率反映结果和不确定性。该目标不能确保在每个工作负载上的可靠性。
Jev 如何工作:输入上下文,输出三种答案

一个应用程序编程接口(API)让应用程序代码发送请求并接收响应。使用 Jev,应用程序提供状态——关于情况的信息——和问题。状态不是持久性内存:Jev 不浏览、不获取账单记录,也不会自动记住之前的请求。
考虑这个虚构的消息:”我的订阅续费在我的卡账单上出现了两次。请退回多余的付款。我很烦恼还要再跟进一次,但我很感谢你的帮助。”该费用仍然是客户的声明。标准定义了用于判断它的类别或描述级别。Jev 的三个基本单元或小构建块涵盖了这些问题类型:
| 问题类型 | 问题和允许的答案 | 返回的内容 |
|---|---|---|
| 选择 | 哪个部门?账单:费用/退款/订阅;技术:功能故障;账户:登录/个人资料/访问权限 | 选定的选项、每个选项的概率和置信度 |
| 评分 | 表达了沮丧?0:中立,无烦恼;1:烦恼但建设性;2:敌对措辞或威胁取消 | 从级别概率计算的 0–2 分数,加上级别图例、概率和置信度 |
| Noul(API 对是/否概率的名称) | 明确要求退款或账户抵免?仅有账单投诉不符合条件 | 0 到 1 的是概率;没有单独的原生置信度字段 |

三者都接收相同的提供的上下文。应用程序随后合并它们的结果,并将不确定的情况发送以供审查;回复草拟单独处理。问题并行针对共享状态运行;在该调用中,没有一个读取另一个的答案。这不会使客户属性或预测错误在统计上独立。评分可以在级别之间下降,因为它使用它们的概率对它们的数字进行平均。这里它描述了表达的沮丧——而不是紧迫性、交易价值或退款资格。
如果答案决定了要检索哪些记录或接下来提供哪些选项,则从属问题需要稍后的请求。额外的问题会增加可计费的输入。每个请求也有它可以接受的文本量的限制,所以你不能无限期地继续添加问题。真实的部门列表也需要一个其他/无或审查路径,用于不属于这三个类别的消息。
你可以用 Jev 实际做什么

在支持工作流中,计费标签可以将消息发送到正确的队列,而退款请求标志可以告诉员工客户想要什么。挫折评级可以帮助优先处理后续跟进或人工审查以及工单的其他详情。这些是说明性用途,不是观察到的 Jev 结果;紧急程度和财务影响需要自己的证据。
计费调查遵循不同的路径:应用程序检索权威支付记录并检查重复结算费用。退款执行必须满足精确的政策检查并验证身份和授权,并获得适当批准。强大的模型预测不会改变这些要求。回复起草属于单独的组件。文明的客户可能有权获得退款,而愤怒的客户可能弄错了。情感与权利检查无关。其他代码控制的工作流以类似的方式分工:
| 工作流 | Jev 决定什么 | Jev 之外保留什么 |
|---|---|---|
| 模型/工具路由 | 使用提供的请求和选择标准在命名选项中进行选择 | 代码调用选定的服务、验证参数并处理回退或不可用选项 |
| 段落重新排序 | 评估已检索段落的相关性,以便可以重新排序候选项 | 检索提供候选项;代码对其进行排序;另一个组件编写并验证答案 |
| 有界提取/标记 | 选择文档标签或匹配候选字段值,包括”未说明” | 解析器或另一个模型查找候选值;代码验证并组装记录 |
| 操作/文本警报审查 | 在提供的操作描述或警报中标记陈述的风险含义或政策问题 | 权限、沙箱、精确检查和人工/安全审查保持为单独的控制 |
对于企业,潜在的节省来自减少重复分类,但 Jev 不是开箱即用的无代码操作管理器。集成所有者必须定义类别并标记代表性示例。这些示例有助于衡量错误和审查工作是否超过节省。现有的可靠规则仍然有用;机会在于这些规则无法很好解释的消息。
自托管用户可以在现有的帮助台、队列或文档工作流中添加解释,而无需在本地拥有模型。安全筛选是补充审查:它不会替代防火墙或防病毒软件。它也不是完整的攻击检测器或授予授权的边界。TypeSafe 的文档化对抗内容限制意味着恶意文本也可能影响此审查者。标记的问题邀请调查;未标记的输入不是安全证书。
为什么这次发布吸引了关注——以及如何解读这些数字
Jev的数字是评估它的理由,而不是对你的应用的预测。在大容量排序和交互式路由中,小的成本和延迟会累积。并行判断、低输入定价和无输出token费用解释了它的吸引力。LangChain的集成讨论和Browserbase的实现报告显示开发者兴趣,而不是普遍采用或生产成熟度。
在其发布证据中,TypeSafe报告显示70–500毫秒的端到端响应和工作流比较大约快194倍、便宜445倍。它将标题收益描述为预期现实世界改进的高端。它们不是通用乘数或服务级别保证。

TypeSafe构建了自己的测试工作流,使用其他模型的概率而不是独立标记的事实基础真实。
- 西海岸测试、有利于Jev的短演示输入,以及比较包装器和设置也限制了结果的适用范围。
- Browserbase的9月21日报告提供了一个具体的混合示例:早期Stagehand Act中位延迟从1.97秒下降到0.46秒——大约快4.3倍——Jev选择有界候选、Stagehand在代码中执行,LLM处理回退。这个实现者报告的结果不是独立复现或通用基准。
📝 注意——输入定价不是总系统成本:根据2026年10月5日的检查,TypeSafe列出jev-1.13.0的价格为每百万输入token $0.042,无输出token费用。Token是文本块——不是请求或确切的字数——可计费输入包括状态和问题。
假设100,000个请求×1,000个输入token = 1亿个token,成本为$4.20。重试、其他模型调用、托管、工程和人工审查会增加成本。如果质量和回退率可接受,重复判断可能是经济的;这个例子既不是完整系统报价,也不是保证的回报。
概率和置信度真正告诉你什么
- 概率表示模型认为答案的可能性:计费而非技术支持,或对退款请求问题的肯定回答。
- 校准描述这些估计如何与代表性预测的结果相匹配。
对于校准良好的80%降雨预报,在分配该概率的类似情况中,大约80%的时间应该会下雨。同样,该概率组中预测标签中大约80%应该是正确的——不一定是任何特定标签。TypeSafe描述了面向校准的训练;你的工作负载仍然需要验证。
Choice和Score也返回置信度,这是一个从概率如何分布在答案中得出的统计数据。一个说明性的——而非测量的——三选项Choice,其最高概率为0.90,在当前记录的规则下置信度为0.85。第一个估计答案的可能性;第二个显示它如何清晰地击败其他选项。置信度不是单独的事实检查或85%的正确概率。

Score描述你的量表上的位置:低挫折感可以以高置信度预测。中间分数可以反映集中在中间的概率或在相反极端之间分散的概率,因此检查分布。接近0.5的Noul意味着是/否的歧义,而不是中等挫折感。其是概率承载不确定性;没有本机置信度字段。
警告——自动化前验证:从另一个工作负载复制的截断值可能不适合你的消息。使用具有已知标签的代表性示例来检查预测错误以及多少情况需要审查或回退。
使用这些结果来决定哪些消息可以自动路由,哪些需要确认,哪些需要人工审查。截断值应该反映错误的后果:误路由可逆转的工单不同于授权付款。这使置信度作为路由信号很有用,阈值是为你的任务选择的,而不是作为通用数字处理。
Jev 无法做的事——以及炒作中遗漏的内容
TypeSafe 的”不会幻觉”声明描述的是输出格式。对于实际可靠性,相关问题是 Jev 在哪里存在困难以及失败如何表现。不正确的预测需要与失败的 API 请求不同的响应。如果预测是正确的,失败可能在于应用逻辑如何使用它。
受限的接口也排除了要求 Jev 提供散文、代码或其推理解释的可能性。对于这些输出,请使用生成式 LLM。在输入方面,Jev 接受文本,包括支持的 JSON 结构——不接受直接的图像、音频或视频。处理媒体需要单独的预处理服务来提供文本或结构化字段。

精确算术、计数和日期比较应该在代码中进行。扩展的多跳判断也不适合。对于提取,Jev 从你提供的候选项或组件中选择;它不会自由生成任意字符串或从分数重建退款金额。TypeSafe 的 Jev 1.13 限制(2026 年 10 月 2 日审查)汇总了其他几个实际弱点:
- 措辞和标准:字面理解、间接表述和矛盾的标准可能会误导模型。使用狭义、明确的问题和一致的描述。
- 上下文:无关的状态可能会分散它的注意力。先检索和过滤,而不是发送每条可用记录。
- 输入和选项:对抗性文本和选项顺序可能会影响答案。测试恶意输入和重新排序的选项;这些测试不提供豁免权。
当前模型文档表示英语表现最佳;在你自己的内容上评估其他语言。它还列出了精确的上下文限制:容量是有限的,大窗口不保证完美的注意力。版本别名可能会在不改变应用的情况下移动,因此当版本更改时重新评估调整的阈值。目前不提供特定客户的额外模型训练;你通过上下文和问题标准来塑造领域行为。
你能自托管 Jev 吗?VPS 的作用
推理是指运行模型来回答请求。根据 10 月 5 日的检查,文档中的公开服务通过 TypeSafe 的 API 提供 Jev 推理。审查的文档既没有提供公开可下载的模型权重,也没有提供标准的本地部署路径。开放集成代码不等于开放模型权重:你可以自托管应用程序,但 Jev 仍然是外部的。
VPS(虚拟专用服务器)可以托管周围的应用程序。大小合适的 AlexHost VPS 可以运行调用 Jev 的后端或工作程序。它还可以托管应用程序的队列、数据库或审查界面。模型访问和 API 费用是单独的。你既不需要购买服务器也不需要 GPU 来尝试托管服务;根据应用程序流量和本地工作负载来调整托管大小,而不是 Jev 推理。

应用程序、记录和审查界面可以在你的服务器上运行,而选定的上下文会传递到 TypeSafe 进行推理,决策会返回到后端。
警告 — 自托管应用程序并不意味着本地推理:选定的状态会离开你的托管边界。无培训承诺并不意味着默认零保留。在通过此工作流发送敏感信息之前,请检查适用的提供商条款。
TypeSafe 的隐私政策排除了对输入的培训或微调。它还描述了美国托管并允许根据需要保留。其法律概述为企业提供了零数据保留 (ZDR),受适用条款的约束。对于个人数据工作流,数据处理协议涉及处理和国际转移;服务器位置只是决策的一部分。
仅发送做出决策所需的上下文,排除机密和不必要的个人数据。保护提供商密钥并保持访问控制到位。保持超时/速率限制回退,例如排队等待审查;将失败的请求与不确定的答案分开处理。作为应用程序运营商,你仍然负责修补和监控。备份和工作流策略也由你负责。
谁应该考虑使用 Jev——谁应该跳过它?

Jev 通过带有预定义答案的问题将语义判断引入软件。
- 它可以路由客户消息
- 评估段落的相关性
- 估计请求是否符合规定的标准,返回类型化结果和应用代码可以使用的概率。
它的吸引力在于使这些重复决策快速且廉价。实际价值仍然取决于明确的标准、相关的上下文和在您自己的示例上的性能。受限的答案可能是错误的,概率有助于指导审查而不是保证正确性。
对于要求”退回额外付款”的客户,Jev 的作用是识别请求并帮助将其发送到正确的位置。记录、权限和退款执行仍由应用程序处理。从使用托管 API 的小型可审查工作流开始,然后测量准确性、回退需求和总成本。这是 Jev 的承诺变得具体的地方:有用的判断与明确定义的下一步相关联。
