一、AI正在出现一个新的技术方向:不生成内容,而是直接作出决策
过去几年,人工智能的发展主要围绕大语言模型(LLM)展开。从ChatGPT到各类推理模型,技术进步的重要标志是模型能够理解多么复杂的问题、生成多么准确的答案,以及完成多么困难的推理任务。
然而,当AI逐渐从聊天工具转变为软件系统、业务流程和工业设备中的自动化组件时,一个新的问题开始凸显:
很多实际应用根本不需要AI生成一段文字,而只需要它快速、准确地作出一个判断。
例如:
- 判断一条报警信息是否需要立即处理。
- 从多个工具中选择最适合当前任务的工具。
- 判断一份检测报告是否满足规定要求。
- 评估AI智能体提出的操作是否存在风险。
- 根据设备状态,在预定义的几种处理措施中作出选择。
对于这些任务,让一个大型推理模型先理解问题、生成分析过程,再输出自然语言结论,往往并不是最高效的解决办法。
因此,一类专门面向机器和软件系统的人工智能模型开始进入产业视野:结构化决策模型(Structured Decision Models),也常被称为Decision Models或Decision-Scoring Models。
2026年9月至10月,三项产业进展尤其值得关注:
- TypeSafe AI于9月15日推出System One Models及首款模型Jev,强调类型化输出、经过校准的概率以及并行决策。
- OpenAI推出专用Decisions API,通过固定的决策类型,将文本和图像直接转化为程序能够处理的判断结果。
- Microsoft于10月9日正式介绍Microsoft-Decision-1,将结构化决策能力带入Microsoft Foundry,并披露了模型架构、测试结果和实际应用案例。
三者共同体现出一个值得关注的变化:AI的能力正在从面向人的自然语言交互,进一步延伸到面向软件系统的低延迟、可组合、可控制的智能判断。
需要说明的是,结构化决策并不是2026年才出现的概念。传统机器学习中的分类器、概率预测、排序模型和决策树,早已具备类似能力。此次出现的新趋势,是将通用预训练模型的语言理解与推理能力,专门优化成能够处理多种任务的统一决策接口。
也就是说,这不是简单地把大语言模型的输出改成JSON,而是开始将决策本身作为独立的模型能力和推理服务来设计。

二、结构化决策模型究竟是什么?
可以把结构化决策模型理解为一种具有自然语言理解能力的可编程判断器。
传统大语言模型的工作方式通常是:
输入问题 → 理解与推理 → 逐词生成回答 → 应用程序解析回答。
结构化决策模型则采用另一种方式:
输入状态及候选选项 → 模型评估 → 输出选项及概率 → 应用程序执行相应逻辑。
它的基本接口通常包含三个部分:
- State(状态):模型需要判断的事实、文本、业务数据或其他信息。
- Questions(问题):要求模型进行的具体判断,以及允许的结果范围。
- Answers(答案):由模型直接返回的数值、类别和概率分布。
这一设计将自然语言理解能力与确定性程序逻辑连接起来。
1. 三类基本决策原语
目前,TypeSafe AI、OpenAI和Microsoft都采用了非常相似的三类基本判断方式。
| 决策类型 | 功能 | 举例 |
|---|---|---|
| Predicate / Noul | 判断条件是否成立 | 设备是否出现异常振动? |
| Choice | 从预定义选项中选择 | 异常属于机械、电气还是传感器故障? |
| Score | 按规定等级评分 | 该故障的严重程度是多少? |
第一类:条件判断。
例如,系统向模型提供设备检测记录,要求判断是否存在异常振动。
模型可能输出异常概率0.92,而不是生成“根据检测数据分析,该设备很可能存在异常振动”这样的文字。
应用程序收到0.92后,就可以执行预设的处理规则。
第二类:多选项决策。
例如,系统已经识别到设备异常,需要将故障划分为三个类别。

第三类:等级评分。
例如,故障严重程度分为四级:正常、轻微、严重、紧急。
模型可以给出各级的概率,再计算概率加权平均分。假设四级的概率分别为10%、20%、60%、10%,对应等级编号为0、1、2、3,那么综合得分就是1.7。
这里的1.7不是一个新的故障等级,而是对多个等级可能性的汇总,可用于排序和优先级管理。
2. 为什么概率比单纯的判断结果更重要?
结构化决策模型的核心价值,不仅在于输出一个选择,还在于能够表达不确定性。
例如,系统对1000条报警分别给出90%的异常概率。如果这些预测经过良好校准,那么在条件相近的大量样本中,理论上应有约900条确实异常。
这就是概率校准(Probability Calibration)的含义。
概率校准与分类准确率是两个不同指标。
一个模型即使总体分类准确率很高,也可能在错误判断时表现得过度自信。对于自动化系统,这种问题尤其危险,因为程序可能依据虚高的概率直接执行错误操作。
因此,结构化决策模型需要同时考虑准确率、概率校准和错误决策的代价。
另外还必须区分:
- Probability(概率):某个候选结果成立的估计可能性。
- Confidence(置信度):对概率分布集中程度的概括,具体定义因供应商而异。
例如,TypeSafe的Choice置信度是根据最高候选概率与均匀分布之间的距离计算的,并不等于最高候选概率本身。不能将不同供应商返回的confidence直接当作含义完全相同的数字比较。
三、关键技术原理:为什么它们能够更快?
结构化决策模型与传统大语言模型的重要区别,发生在模型优化目标、输出机制和计算方式上。
1. 不再依赖完整的自回归文本生成
典型的大语言模型主要采用自回归(Autoregressive)方式生成内容:先生成第一个Token,再依据前面的内容生成第二个Token,以此类推。
这种机制非常适合生成文章、代码和推理过程,但对于只需要返回一个判断的任务,可能存在不必要的计算开销。
结构化决策模型则可以通过专门训练,在完成输入编码后,直接计算各候选结果的分数或概率。
这样既减少了输出阶段的计算,也避免了额外的文本解析过程。
不过,这并不意味着所有结构化决策模型都完全采用相同的新型神经网络架构。部分模型仍然建立在Transformer大语言模型之上,只是通过训练与推理接口优化,改变了最终的输出方式。
2. 在同一次请求中并行评估多个问题
TypeSafe的Jev强调一种并行决策方式:多个相互独立的问题可以共享同一份输入状态,并在一次请求中完成评估。
例如,一个设备检测任务可以同时判断:
- 是否存在异常?
- 最可能的故障类型是什么?
- 故障严重程度如何?
- 是否需要人工复核?
由于不必让模型依次生成四段解释,这种方式有望明显降低整体延迟。
但要注意,只有可以独立评估的问题才适合这种并行机制。如果第二个问题必须依赖第一个问题的答案,通常还需要通过程序控制下一次调用。
3. 使用专门的训练目标
传统聊天模型常使用RLHF(基于人类反馈的强化学习),而推理模型也会使用RLVR(基于可验证奖励的强化学习)。
TypeSafe提出了RLCD,即:
Reinforcement Learning for Calibrated Decisions——面向概率校准决策的强化学习。
它强调训练模型输出可靠的决策分布,而不是让模型生成符合人类偏好的自然语言表达。
Microsoft则采用另一种技术路径:以开源权重模型为基础,通过后训练将其优化成专用的决策评分模型。
两种方案反映出结构化决策模型正在形成不同技术路线:一类强调专用模型架构和训练范式,另一类强调利用现有预训练模型的能力进行针对性改造。
不过,目前公开资料尚不足以完整复现TypeSafe的RLCD训练过程,因此不能仅凭其名称就认定该训练方法相较其他概率校准方法具有普遍优势。
四、产业格局:五条值得关注的技术路线
截至2026年10月11日,结构化决策模型已经不再是TypeSafe一家公司的探索。OpenAI、Microsoft及多个开源项目都已进入这一领域。
1. TypeSafe AI:将决策模型作为新的AI基础组件
TypeSafe AI由Diogo Almeida创立。其核心观点是:未来大量AI应用将发生在软件与软件之间,而不是人与聊天机器人之间。
2026年9月15日,TypeSafe发布首款System One模型Jev。
其主要特点包括类型安全输出、概率校准、多个问题并行评估,以及面向软件自动化的低延迟推理。
TypeSafe公开的测试声称,在其选定的工作流任务中,Jev相比传统大语言模型方案实现了约193.6倍速度提升和444.6倍成本降低。
但这些数字并非普遍适用的性能结论。TypeSafe也说明,测试采用了特定工作流和参考模型,测试设计本身可能存在偏向。
值得关注的是其提出的理念:将AI作为软件中的一个智能函数,而不是一个会聊天的助手。
2. OpenAI:通过专用API提供决策能力
OpenAI于2026年10月6日正式推出Decisions API公开测试版,当前使用gpt-6-luna模型。
其技术特点是将决策能力封装为独立接口:
POST /v1/decisions
它支持文本和图像输入,提供Predicate、Choice和Score三类输出。
官方称,相比通过Responses API完成同类工作,Decisions API约快10倍。目前的公开定价为每百万输入Token 0.10美元,不收取输出Token费用。
OpenAI路线的一个重要特点,是直接在既有模型与API平台中提供决策接口。
不过,公开资料并未充分披露其底层是否采用独立决策头、专门的后训练机制或其他推理优化,因此不能简单认定它与Jev拥有完全相同的神经网络结构。
3. Microsoft:基于Qwen3.5-9B构建专用决策模型
Microsoft-Decision-1于2026年10月9日正式介绍,是当前非常值得关注的一项进展。
根据Microsoft的披露:
- 基础模型为阿里巴巴开源权重的Qwen3.5-9B。
- Microsoft进行了针对决策评分任务的后训练。
- 采用单次推理输出候选选项的概率。
- 支持最长32K Token上下文。
- 当前仅支持文本输入,不支持图像、音频和视频。
Microsoft公布的36项基准测试覆盖接近15万个问题。公司称其模型在综合准确率测试中领先,并且具备显著的延迟优势。
Microsoft还披露了实际使用案例。Xbox研究团队利用该模型将超过1万条用户反馈分配到预定义主题;Copilot团队利用它评估AI回复质量;Microsoft Discovery则将其用于科学研究智能体中的实验结果评分和动态重新规划。
其中,Microsoft Discovery的案例尤其值得关注:结构化决策模型开始承担科研智能体中反复发生的评估和控制任务,而不仅仅是普通文本分类。
目前Microsoft Foundry目录显示该模型处于正式可用状态,公开定价为每百万输入Token 0.042美元,输出Token免费。
4. H2O.ai:推动开放权重和本地部署
H2O.ai推出的H2O-Lightning-4B,建立在Qwen3.5-4B基础之上,采用Apache 2.0许可证发布。
这个模型不仅可以处理文本决策,也支持结合图像进行判断。它采用单次前向计算和极短输出的方式,并提供基于vLLM的部署方案。
在JevBench相关测试中,H2O-Lightning-4B v1.1表现出了有竞争力的速度、成本和决策能力。不过,测试中的部署成本部分属于估算,不应直接当作实际商业服务价格。
它的重要意义是:结构化决策模型开始具备可自行部署的实现路线,企业不再只能通过云端闭源API使用这种能力。
5. Strands Decider:更明确的专用网络结构
开源项目Strands Decider提供了另一种值得研究的技术实现。
其约19亿参数的模型使用Qwen3.5-2B作为基础,将传统的语言建模输出头替换为专门的选项评分头,通过隐藏状态计算候选答案的分数。
因此,它不需要生成完整答案,而是直接完成候选选项评分。项目公开了网络设计、训练方法和测试结果。
这一方案表明,结构化决策不只是改变API返回格式,也可以深入到神经网络输出层和训练机制。
主要模型与平台对比
| 模型或平台 | 技术特点 | 输入支持 | 部署方式 |
|---|---|---|---|
| TypeSafe Jev | System One、RLCD、并行决策 | 结构化状态、文本 | 商业API,早期访问 |
| OpenAI Decisions API | GPT-6 Luna专用决策接口 | 文本、图像 | 云端API,公开测试 |
| Microsoft-Decision-1 | Qwen3.5-9B后训练,单次评分 | 文本 | Microsoft Foundry |
| H2O-Lightning-4B | 4B级模型,开放权重 | 文本、图像 | 可自行部署 |
| Strands Decider | 约1.9B参数,专用评分头 | 文本 | 开源部署 |
从技术路线看,这个领域已经形成了三种趋势:专门设计的决策模型、从通用预训练模型改造而来的决策模型,以及在大型AI平台内部提供的专用决策API。
目前还不能断言哪种路线最终胜出。各家公布的测试任务、输入长度、硬件环境及指标计算方式并不完全一致,跨厂商性能倍数尤其需要谨慎看待。
五、结构化决策模型最有价值的应用领域
1. AI智能体的流程控制
传统AI智能体经常使用同一个大语言模型处理所有环节,包括理解需求、选择工具、生成参数、检查结果和决定下一步动作。
这种方式虽然通用,但当智能体需要连续执行几十甚至上百个操作时,决策步骤的延迟和费用会不断累积。
结构化决策模型可以专门负责其中的轻量判断,例如选择工具、决定是否重试、判断是否需要人工审批。
大型推理模型则继续承担复杂分析、规划和内容生成任务。
这形成一种新的智能体架构:复杂任务由推理模型完成,频繁决策由专用模型完成。
2. 工业设备监测与故障诊断
对于工业设备监测,结构化决策模型可以用于连接已有的检测算法和业务处理逻辑。
例如,在工业设备(动设备)故障检测中,首先由振动、电流、距离等传感器提供数据,再由信号处理算法和故障分类模型识别异常。
结构化决策模型不一定直接处理高频原始波形,而是更适合利用已经提取的特征、检测结果、设备运行状态和维护规则,进一步判断:
- 当前异常是否需要复核?
- 应优先检查哪类故障?
- 是否需要安排维保?
- 需要上报给哪个系统或责任人员?
这样可以将传统故障分类模型、业务知识和工作流控制结合起来。
需要强调的是,涉及安全关键设备时,结构化决策模型不能替代安全PLC、硬件联锁、法定保护装置或经过验证的安全控制逻辑。
它更适合应用于辅助诊断、维保优先级、工单分配与信息处理等非安全保护层面。
3. AI for Science与科研智能体
科研智能体包含许多需要重复判断的任务,例如评估候选实验、筛选研究假设、判定实验数据是否满足要求,以及决定是否继续开展下一轮实验。
结构化决策模型可以承担这些高频判断,使复杂推理模型把更多计算资源集中在研究规划、机理分析和科学解释上。
Microsoft Discovery的相关测试,已经体现出这种技术组合的潜力。
4. 企业流程与软件质量控制
另外一个具有商业价值的领域是企业自动化。
例如,针对合同审查、票据处理、技术支持、软件测试和信息安全审计,可以将原来的规则与AI判断组合成程序化工作流。
关键原则是:确定性的事实和规则仍由程序处理,只有难以完全用固定规则表达的判断交给模型。
这能够减少模型自由发挥的空间,也使整个系统更容易测试、回溯和审计。
六、现阶段必须正视的局限性
尽管结构化决策模型具有明显的工程价值,但它并不是一种不会出错的人工智能。
首先,输出格式正确不代表判断内容正确。
TypeSafe强调类型安全,甚至使用不会产生幻觉的宣传表述。准确地说,类型约束可以避免模型生成不符合接口要求的自由文本或非法选项,却不能从根本上消除错误分类、事实误判和语义理解偏差。
其次,输出概率并不意味着概率一定可靠。
概率校准必须通过真实样本验证,尤其需要关注数据分布发生变化时的表现。
例如,一个模型在普通设备故障数据上得到良好校准,不代表它在罕见故障、传感器失效或设备老化后的数据上仍然可靠。
这一问题在经典机器学习中早已有系统研究。Guo等人在2017年发表于ICML的论文《On Calibration of Modern Neural Networks》就指出,神经网络的预测概率可能存在明显的校准问题。
第三,候选答案的设计可能直接影响决策质量。
如果程序只允许在A、B、C三种故障中选择,而真实情况是未知故障D,模型可能仍然会把概率分配给已有选项。
因此,实际系统往往需要提供“无法判断”“其他类别”或“转人工处理”等选项。
第四,缺少公开统一的验证体系。
JevBench等项目正在推动结构化决策模型的横向评测,但行业还需要更成熟的测试方法,包括:
- 准确率与概率校准的联合评价。
- 候选选项顺序变化后的结果稳定性。
- 未知类别和分布外数据的处理能力。
- 端到端延迟、系统吞吐量和真实部署成本。
- 提示注入、恶意输入以及关键决策的安全性。
对于高风险应用,不能仅依据模型提供的置信度决定是否自动执行操作。Microsoft也明确指出,Microsoft-Decision-1不应作为信贷、就业、医疗、教育及法律权利等重大个人决策的唯一自动决策依据。
七、未来发展趋势
从当前产业进展判断,结构化决策模型的发展可能沿着四个方向展开。
第一,成为AI智能体的基础控制组件。
未来的智能体架构可能进一步分层:通用大模型负责理解、规划和创造,结构化决策模型负责路由、评价和状态转换,传统程序负责确定性执行。
这种分工有助于降低复杂智能体系统的总体成本。
第二,从纯文本扩展到多模态。
OpenAI Decisions API已经支持图像输入,H2O-Lightning-4B也提供相关能力。未来,结构化决策模型可能进一步处理工业图像、屏幕状态、音频事件和其他感知结果。
不过,多模态输入并不意味着能够直接用于硬实时控制,实际部署仍取决于传感、计算和通信链路的延迟。
第三,小模型和边缘部署可能成为重要分支。
对于只需完成少量固定决策的应用,较小的专用模型具有吸引力。
从开源的2B、4B级模型可以看到,行业已经开始探索将这类能力部署在企业自有计算基础设施上。进一步通过蒸馏、量化和推理优化,有望拓展其在边缘AI中的应用。
但具体设备是否具备足够的内存、算力和实时性能,仍需根据模型实测决定。
第四,决策模型可能逐渐形成标准化接口。
目前多家厂商都使用类似的Predicate/Noul、Choice和Score结构,说明行业在基础能力上出现了一定程度的趋同。
这为未来跨模型切换、统一测试、模型路由和混合部署提供了条件。不过,这些接口尚不能视为完全统一的行业标准。
八、结论:结构化决策模型可能成为AI软件工程的重要基础设施
结构化决策模型的兴起,并不意味着大语言模型正在被替代,而是说明人工智能的软件架构正在进一步专业化。
过去,许多AI应用采用一个通用模型完成从理解到执行的所有工作。现在,产业界开始尝试将这些工作拆分成具有不同性能和可靠性要求的组件。
其中,结构化决策模型的价值在于,把原本隐藏在自然语言回答中的判断能力,转化为程序能够直接消费的概率、类别和评分。
TypeSafe的Jev强调面向机器的专用智能架构;OpenAI通过Decisions API将决策能力集成到通用模型平台;Microsoft则展示了利用成熟预训练模型进行决策专用化的可行路径。H2O.ai和Strands Decider的出现,进一步推动了这一方向的开放和工程化。
从技术成熟度看,结构化决策模型目前最适合的定位,是通用大模型、传统机器学习算法与确定性软件系统之间的智能判断层,而不是取代所有传统分类器或安全控制系统。
未来其商业价值能否真正释放,主要取决于三个条件:能否在真实任务中保持可靠的概率校准,能否稳定降低系统的总延迟与成本,以及能否建立清晰、可验证的安全边界。
如果这些问题能够得到有效解决,结构化决策模型有望成为AI智能体、企业软件、工业AI和科研自动化系统中的重要基础组件。
参考文献与资料
以下以官方技术资料、模型文档和公开研究为主,链接均为完整HTTPS地址,不包含跟踪参数。
核心厂商与模型资料
1. TypeSafe AI — Official Website https://typesafe.ai/
2. Introducing System One Models & Jev — TypeSafe AI(2026年9月15日) https://typesafe.ai/blog/introducing-system-one-models-and-jev
3. Introduction — TypeSafe AI Documentation https://docs.typesafe.ai/introduction
4. Confidence — TypeSafe AI Documentation https://docs.typesafe.ai/confidence
5. Decisions — OpenAI API https://developers.openai.com/api/docs/guides/decisions
6. Changelog — OpenAI API(含2026年10月6日Decisions API发布记录) https://developers.openai.com/api/docs/changelog
7. Microsoft-Decision-1 — Microsoft Foundry Model Catalog https://ai.azure.com/catalog/models/Microsoft-Decision-1
8. Introducing Microsoft-Decision-1, Our Model for Fast Decision-Making — Microsoft(2026年10月9日) https://commandline.microsoft.com/microsoft-decision-1-model-foundry/
9. Deploy and Use Microsoft-Decision-1 in Microsoft Foundry — Microsoft Learn https://learn.microsoft.com/en-us/azure/foundry/foundry-models/how-to/use-foundry-models-microsoft-decision
开源实现与评测资料
10. H2O-Lightning-4B — H2O.ai Model Card https://huggingface.co/h2oai/h2o-lightning-4b
11. Strands Decider — GitHub Repository https://github.com/strands-labs/strands-decider
12. Jev vs H2O-Lightning-4B v1.1 — JevBench / Benchmark Heaven https://benchmarkheaven.com/jev-models/jev-vs-h2o-lightning-4b
13. Workflow Evals — TypeSafe AI https://evals.typesafe.ai/
基础学术研究
14. On Calibration of Modern Neural Networks — Guo et al., ICML 2017 https://proceedings.mlr.press/v70/guo17a.html