声明
严正声明:本站非期刊官网,非中介代理。
本站仅提供学术规范服务:快速预审、润色编辑服务、中英文查重、降重、去重服务、推荐合适的期刊投稿等学术规范服务。 如需提供学术规范服务请联系在线编辑。
国内刊号:11-1421/N
国际刊号:1000-7857
发布日期:
作者:张慧, 谢东锦, 梁姝彤, 李明轩, 贾晓丰, 田永林, 马思吉, 李浩然, 李浥东
单位:1北京交通大学计算机科学与技术学院,北京100044;2新疆大学软件学院,乌鲁木齐830046;3北京市大数据中心,北京101117;4中国科学院自动化研究所,北京100190;5澳门科技大学创新工程学院,澳门999078;
关键词:视觉−语言−动作模型,多模态学习,具身智能,大语言模型
基金:国家自然科学基金青年项目(62203040)
人工智能正经历从“感知智能”“认知智能”向“具身智能(embodied intelligence)”的深刻演进。传统的人工智能系统能够识别图像、理解语言,但往往止步于“知”的层面,无法进一步完成“行”的环节。实现从“能感知”“会思考”到“可行动”的跃迁,是智能体走出虚拟空间、进入真实世界的关键所在。正如Brooks在1991年所提出的“智能源于与环境交互”的经典观点[1],具身智能的本质是通过感知、认知与行动三大能力的闭环融合,使智能体能够在开放环境中自主感知世界、理解意图并执行任务。围绕这一目标,视觉−语言−动作(vision−language−action,VLA)模型的提出成为支撑具身智能落地的核心技术路径。
来源:2025年第20期
《科技导报》期刊编辑部
严正声明:本站非期刊官网,非中介代理。
本站仅提供学术规范服务:快速预审、润色编辑服务、中英文查重、降重、去重服务、推荐合适的期刊投稿等学术规范服务。 如需提供学术规范服务请联系在线编辑。