题目:Synergy of Giants and Specialists: A Large-and-Small Model Integration Framework Driven by Generative AI for Smart Manufacturing
发表时间:2026年2月5日
期刊:《Robotics and Computer-Integrated Manufacturing》
作者:西安交通大学周光辉教授,张超副教授,博士生徐青峰等
简介:本文提出一种“巨人与专家”协同的大小模型集成工艺规划框架,通过微调视觉语言大模型进行工艺规划语义翻译,联合知识图谱嵌入模型、深度强化学习等小模型进行推理决策,有效解决大模型在工业领域的“幻觉”风险与传统小模型的感知瓶颈,显著提升复杂机械加工工艺规划的准确性与鲁棒性。
原文链接:https://www.sciencedirect.com/science/article/pii/S0736584526000335
引用本文:Xu, Q., Zhang, C., Ma, D. et al. Synergy of giants and specialists: A large-and-small model integration framework driven by generative AI for smart manufacturing. Robot. Comput.-Integr. Manuf. 100, 0736-5845 (2026). https://doi.org/10.1016/j.rcim.2026.103254
摘要:生成式人工智能(GenAI)基础模型,特别是大型语言和视觉模型(LMs)的出现,有望彻底改变智能制造。然而,它们的应用受到“幻觉”现象以及缺乏特定领域知识支撑的阻碍。相反,传统的小模型(SMs)虽然精确,但在处理工程图纸等非结构化输入时却面临困难。为了弥合这一差距,本文提出了一种专门用于自动化机械加工工艺规划的协同式大小模型(LSM)集成框架。在该框架中,“巨人”——即经过领域适配的视觉-语言模型(VLM)LLaVA,作为感知前端,负责将复杂的二维工程图纸和几何公差转化为结构化实体。这些实体为“专家”推理系统提供了基础支撑,该系统包含一个基于Transformer的知识图谱(KG)嵌入模型(TransEx)和一个由广义优势估计-近端策略优化(GAE-PPO)策略指导的深度强化学习(DRL)智能体。这种协同作用实现了可解释的多跳推理,从而能够自主确定最佳的加工路线和切削参数。实验结果证明了该框架的有效性:VLM实现了83.24%的工艺识别准确率,且与基准方法相比,该完整流程将知识推理准确率提高了13.51%,累积奖励提高了49.01%。这项工作提出了一个稳健的框架,通过“巨人”与“专家”之间的协同,为实现先进的工业自动化提供了一条可扩展的路径。
关键词:生成式人工智能,大小模型协同,智能制造,知识图谱,深度强化学习
一、方法部分:
针对智能制造工艺规划中非结构化输入理解难与决策过程“黑盒”化的问题,首先构建了“巨人与专家协同”(LSM)的集成框架。该框架将复杂的工艺决策任务分解为感知翻译、知识表示与推理决策三个协同阶段。如图1所示,微调后的视觉-语言模型(LLaVA)作为“巨人”前端,负责将多模态输入转化为结构化实体;基于Transformer的知识图谱嵌入模型(TransEx)作为“专家”构建语义地图;深度强化学习(DRL)智能体则作为“导航员”在图谱上执行可解释的路径搜索。
图1创新式工艺规划的整体框架
在第一阶段的多模态感知与翻译中,采用领域自适应的LLaVA模型处理工程图纸与文本查询。如图2所示,模型通过视觉编码器(CLIP)提取图像特征,经线性投影后与文本特征融合,生成统一的多模态语义表示。为了克服通用大模型的幻觉问题,我们利用均方误差(MSE)损失函数在企业真实工艺数据上微调模型,使其能够从图纸中精确提取非规范化实体(如“45号钢”),并通过计算余弦相似度将其映射为知识图谱中的唯一规范节点,完成从非结构化信息到结构化知识的“语义翻译”。
图2用于多模态意图识别和实体提取的LLaVA架构
第二阶段由TransEx模型负责知识表示,旨在解决制造工艺知识图谱中广泛存在的非对称关系(如工序先后顺序不可逆)与复杂语义依赖。如图3所示,TransEx创新性地结合了Transformer编码器与复数嵌入技术。Transformer通过多头注意力机制捕获三元组的上下文依赖,输出增强的向量表示;随后,模型将这些实值向量映射到复数空间,利用厄米特内积(Hermitian dot product)计算评分函数。这种设计利用复数空间的非对称特性,有效建模了有向的工艺逻辑,生成的实体与关系嵌入向量为后续推理提供了高质量的“语义地图”。
图3TransEx的结构
第三阶段执行可解释的推理决策,该过程被建模为马尔可夫决策过程(MDP)。如图4所示,采用基于广义优势估计-近端策略优化(GAE-PPO)策略的DRL智能体进行多跳推理。状态空间由用户查询嵌入、初始实体及当前实体嵌入拼接而成(656维向量);动作空间为知识图谱中的下一跳邻居节点。智能体以TransEx生成的嵌入为环境,在奖励函数(结合终点稀疏奖励与过程相似度奖励)的引导下,自主搜索最优工艺路径。GAE用于平衡优势估计的偏差与方差,PPO通过截断策略更新幅度确保训练稳定性,最终输出一条包含设备、参数和步骤的透明推理链。
图4GAE-PPO的训练框架
二、实验部分:
所提方法已在构建的综合多模态制造数据集(包含1340张工程图和6700条文本描述)以及基于真实工业案例构建的工艺知识图谱(包含15,792个三元组)上进行了验证。实验在配备NVIDIA A800 GPU的服务器上进行大模型微调,并在配备NVIDIA GeForce RTX 4090 GPU的服务器上进行小模型训练与推理。我们采用定量指标与定性分析相结合的方式,分模块及整体对框架进行了评估。
图5 制造工艺微调数据集构建示例:数据集展示了从原始零件图纸和非结构化工艺文本到结构化标注数据的转换过程。通过专家标注,将非规范化的实体字符串映射到知识图谱中的规范节点,为大模型的领域适配提供了高质量真值。
大模型感知模块(LLaVA)的微调过程如图7所示,展示了良好的收敛性。微调后的模型在验证集上的表现如图8所示,最终实现了83.24%的工艺识别准确率(PRA)和80.58%的实体映射准确率(EMA)。
图6 大模型(LLaVA)微调过程
图7 经过微调的LLaVA在PRA和EMA指标上的实验结果:随着训练步骤的增加,PRA和EMA均呈现稳步上升趋势并趋于平稳,证明了多模态感知模块在工艺意图识别和实体映射任务中的有效性。
为了深入理解感知模块的性能,我们进行了定性分析,如图9所示。分析结果显示,模型能够实现精准的输入-输出文本相关性(如“part”对应“flanged shaft”的相关性达0.86),并具备卓越的视觉接地能力,能准确将图纸中的尺寸及公差标注映射到结构化输出中。
图8 基于大模型的工艺意图识别评估与分析:展示了模型的语义关联能力与视觉定位精度。模型不仅能理解文本意图,还能在复杂的工程图纸中准确锁定关键的几何公差和尺寸特征。
在感知性能的对比实验中,如图10所示,微调后的7B参数模型在PRA和EMA指标上显著优于未经微调的7B及更大的13B基准模型,这定量地证明了针对特定制造领域进行微调的必要性。
图9 各种大模型在参数规模、PRA和EMA上的对比分析:结果显示领域适配比单纯增加参数规模更能有效提升模型对复杂制造意图的理解能力。
在知识表示模块(TransEx)的评估中,TransEx在MRR(0.7247)和Hits@10(0.8683)等核心指标上均优于ConvE、ComplEx等传统基准模型。在推理模块(GAE-PPO)评估中,模型在8000个回合内稳定收敛,KIA达到0.8892。同时,GAE-PPO在扩展性和收敛速度上均展现出明显优势,如图13和图14所示。
图10 不同模型KIA值随实体数量的变化趋势图:随着知识图谱规模的扩大,GAE-PPO的性能优势愈发明显,其在全量数据集上的KIA较纯PPO算法提升了13.51%
图11 不同模型推理策略的收敛行为对比图:GAE-PPO展现出最快的初始上升速度和极高的最终累积奖励,相比纯PPO算法其累积奖励提升了49.01%
在整体框架验证方面,我们的全流程框架在测试集上取得了最优表现(SeqAcc:0.865,KPA:0.812),显著优于传统深度学习和纯端到端大模型方案。该流程最终集成于原型系统中,其完整的执行过程和系统架构分别如图17和图18所示。
图12 制造执行机制的完整运作流程示例:展示了系统从接收复杂零件图纸到通过多跳推理链生成规范工艺卡片的自动化过程
图13 原型系统架构与模块协同过程图:该系统实现了“巨人感知”与“专家推理”的无缝对接,为工程师提供了一个可追溯、可验证且安全的自动化工艺规划辅助环境
三、未来与展望:
未来将引入从“专家”到“巨人”的反向反馈机制,通过人在回路(HITL)技术实现模型的自我演进与持续迭代。同时,考虑集成数字孪生或传感器流以实现知识图谱的实时更新,从而适应动态变化的制造环境。此外,还将探索大模型量化与剪枝技术以进一步降低部署门槛,并验证该框架在航空航天、电子组装等跨行业的泛化能力。
【作者简介】:
徐青峰,西安交通大学机械工程学院博士研究生,主要研究方向为工业大模型、知识图谱、数字孪生、智能工艺规划与决策系统。
张超,西安交通大学机械工程学院副教授,航天制造与信息工程研究所副所长。主要研究方向为:人机协同装配、数字孪生以及大语言模型驱动的智能制造。
马东旭,西安交通大学机械工程学院博士研究生,主要研究方向为人机协作装配、视觉语言模型驱动的机器人技术以及数字孪生。
周光辉,西安交通大学机械工程学院教授,博士生导师,机械工程学院副院长,主要研究方向为:工业数字孪生、大数据驱动的智能制造、深度学习与决策支持系统、绿色制造与低碳制造。