ChatGPT共同发明人创办TypeSafe,发布Jev模型专攻程序化逻辑决策
TypeSafe由ChatGPT共同发明人Diogo Almeida创办,结束两年隐身状态,推出不生成文本、只输出类型安全结构化值的Jev模型,并开放早期开发者访问。
AI解读:Jev不生成文本,而是把非结构化状态直接映射为类型安全的概率化决策,用一次并行查询替代逐个token的自回归生成,从架构上规避语法类型错误和输出幻觉。
它面向的是生产代码里需要确定性分支判断的场景,如实时特征提取、PB级数据流和自动分支逻辑;这类任务过去往往要靠大语言模型加解析管线和护栏包装,Jev试图省掉这一层。
TypeSafe公布了自家西海岸服务器上 70–500 毫秒的端到端延迟,以及低至 0.042 美元/百万token的输入价格,输出token不计费。这些是厂商自测数据,实际效果仍取决于具体工作负载。
TypeSafe结束两年隐身状态,发布Jev模型,用于在生产代码库中直接执行结构化的概率化决策。该公司由OpenAI资深成员、ChatGPT共同发明人Diogo Almeida创办。
Jev完全不生成文本和字符串。它不按自回归方式逐个生成文本token,而是接收非结构化状态作为输入,在单次并行查询中输出类型安全的结构化值。
TypeSafe将Jev称为“System One Model”。其架构针对确定性代码集成,声称通过设计避免语法类型失败和输出幻觉。
Almeida这样描述该模型:“把Jev想成一次前沿智能的函数调用:非结构化状态输入,类型化概率决策输出。”
TypeSafe已开放早期开发者访问,并开始从部署等待名单中引入工程团队。
RLCD训练与并行采样架构
工程师围绕一种名为“校准决策强化学习”(Reinforcement Learning for Calibrated Decisions,RLCD)的替代训练方法构建了该平台。
常规前沿模型通过基于人类反馈的强化学习(RLHF)或基于可验证奖励的强化学习(RLVR)训练,以迎合人类对话偏好或通过孤立的程序化检查。TypeSafe训练Jev在执行逻辑上产出校准概率,确保返回的置信分数与输出准确率直接相关。
与自回归token生成不同,Jev依赖一个硬件感知的并行采样器,同时评估并给出所有结构化值。
结构约束把输出限制在预定义schema内,从而消除了在业务自动化流程中部署传统大语言模型时所需的解析管线和护栏包装。内部采样器可处理多达 255 个离散选项的高基数选择,采用两阶段流程,先对选项独立打分再进行选择。
- 训练方法:RLCD,目标是产出校准概率,使置信分数与准确率直接相关
- 生成方式:硬件感知并行采样,一次性输出全部结构化值,非自回归逐token生成
- 输出约束:限制在预定义schema内,可处理最多 255 个离散选项
- 采样流程:两阶段,先独立打分再选择
性能与成本数据
TypeSafe团队在西海岸服务器上进行的内部评估记录到,端到端响应延迟在 70–500 毫秒之间,而对话式前沿部署的延迟为 3–329 秒。
已发布的工作流评估在固定计算图上运行,衡量多步决策分支,并与GPT-6 Astra和Fable 5.1的共识基线对比,记录到的执行速度最高快 193.6 倍。
输入处理定价为每百万token 0.042美元,低于标准对话式费率的每百万token 0.20至 10 美元。由于并行采样不经过自回归token生成过程即可产出结构化状态,TypeSafe对输出token不计费。
- 内部延迟:70–500 毫秒(厂商西海岸服务器自测)
- 对话式前沿部署对照延迟:3–329 秒
- 工作流评估:固定计算图上执行速度最高快 193.6 倍,基线为GPT-6 Astra与Fable 5.1共识
- 输入价格:0.042 美元/百万token,低于 0.20–10 美元/百万token的常规区间
- 输出token:不计费
演示测试与目标场景
生产演示显示,Jev能够解析高速游戏状态和网页遍历树中的分支规则。
在动态压力测试中,工程师在Doom游戏状态结构上运行一个实时反应式机器人,以每秒 10 次查询的速度运行,运营成本约为每小时 7 美元。
另一项Wikiracing测试评估在密集百科目录中的链接选择,通过在不生成幻觉死胡同的情况下评估选项,用比外部非推理模型更少的步骤完成遍历。
现场测试确认的主要目标应用包括实时特征提取、PB级数据工作流、输出验证层,以及手写规则被证明脆弱的自动分支逻辑。
- Doom实时机器人:10 次查询/秒,成本约 7 美元/小时
- Wikiracing:比外部非推理模型用更少步骤完成遍历
- 目标场景:实时特征提取、PB级数据工作流、输出验证层、自动分支逻辑