【导语】11月3日,智元创新(上海)科技有限公司宣布其研发的真机强化学习技术实现从学术到工业应用的突破,在与龙旗科技合作的产线中成功落地。该技术让机器人直接在真实设备上试错学习,实现自主学习与策略优化,具备极速部署、超高适配和柔性换型等优势,将推动工业自动化向更高柔性、更低成本方向迈进。 11月3日,智元创新(上海)科技有限公司(简称:智元机器人)对外宣布该公司研发的真机强化学习技术,首次实现从学术论文阶段走向工业应用,目前在与龙旗科技合作的验证产线中成功落地。相关第三方可验证的实验数据将在后续部署中公布。 智元展示此次落地的真机强化学习方案 。 真机强化学习(Real-World Reinforcement Learning)技术是指,让AI算法直接在真实物理设备上进行强化学习(RL)训练的技术。简单来说,它让机器人不只在虚拟仿真环境里学会策略,而是直接在真机上通过试错学习最优行为。 国外多项学术研究显示,强化学习在工业机器人中的应用具有巨大潜力,但从仿真环境到真机再到工业规模的稳定部署仍面临较多挑战,在机器人研究领域,目前更多的是停留在研究阶段,并未大规模走向工业产线应用。 据了解,这项真机强化学习技术,可让机器人在真实产线中自主学习、持续优化作业策略,新技能训练与稳定部署仅需数十分钟,且性能全程不降级。在换线、换型或流线调整时,该系统只需最小的硬件改动和标准化部署流程,即可显著提升柔性、压缩部署时间与(yǔ)成(chéng)本(běn)。 智(zhì)元(yuán)机(jī)器(qì)人(rén)合(hé)伙(huǒ)人(rén)、首(shǒu)席(xí)科(kē)学(xué)家(jiā)罗(luō)剑(jiàn)岚(lán)告(gào)诉(su)澎(pēng)湃(pài)科(kē)技(jì)(www.thepaper.cn),目(mù)前(qián)这(zhè)套(tào)方(fāng)案(àn)已(yǐ)进(jìn)入(rù)常(cháng)态(tài)化(huà)作(zuò)业(yè)状(zhuàng)态(tài),最(zuì)大(dà)的(de)突(tū)破(pò)点(diǎn)在(zài)于(yú)其(qí)性(xìng)能(néng)真(zhēn)正(zhèng)将(jiāng)AI模型部署在工厂中,实现100%的准确率。在联调机制下,落地工业产线的故障率已经被控制在产线验收范围内。 罗剑岚称,工业产线较为保守,传统自动化设备在具(jù)有(yǒu)不(bù)确(què)定性的场景下,难以同时兼顾高精度、高成功率和通用性,而真机强化学习技术能更好地解决这一问题。真机强化学习技术约80%将应用于集中上下料与柔性换线环节(jié)。 长(zhǎng)期(qī)以(yǐ)来(lái),精(jīng)密(mì)制(zhì)造(zào)产线面临刚性瓶颈。传统机械臂依赖复杂夹具设计与场地改造,调试周期长、换型成本高;“视觉+力控”等柔性方案虽有改进,却存在参数敏感、部署复杂等问题,难以适配消费电子行业高频产品迭代需求。 相较于传统方案,真机强化学习技术具备三大核心优势:极速部署、超高适配和柔性换型,可在不同工位和产品线上快速迁移与复用。其训练周期从“数周”缩短至“数十分钟”,效率实现指数级提升;自主克服来料位置偏差、尺寸公差等扰动,在长周期运行中持续保持工业级稳定性与100%任务完成率(lǜ)。 不(bù)过(guò),相(xiāng)较(jiào)于(yú)仿(fǎng)真(zhēn)学(xué)习(xí),真(zhēn)机(jī)强(qiáng)化(huà)学(xué)习(xí)技(jì)术(shù)或(huò)面(miàn)临(lín)成(chéng)本(běn)高(gāo)昂(áng)等(děng)问(wèn)题(tí)。在(zài)成(chéng)本(běn)控(kòng)制(zhì)方(fāng)面(miàn),罗(luō)剑(jiàn)岚(lán)表(biǎo)示(shì),真(zhēn)机(jī)强(qiáng)化(huà)学(xué)习(xí)技(jì)术(shù)的(de)优(yōu)势(shì)体现在两方面:显性成本方面直接与产能挂钩,提升了生产效率;隐性成本方面,具有高模块化、高柔性率特征,在不同工序间切换非常便捷,只需极小程度的硬件调整。 罗剑岚强调,“随着经验的积累,这一系统在新产线上部署会更快,成本也会越来越低。”他表示,这是一套可管理、可复制、可拓展的工具,未来会将其打造成通用模板进行推广,像搭乐高积木一样,从3C逐步扩展到汽车、家电、医疗等领域。