实施虚拟现实行业“揭榜挂帅”助推XR3.0产业发展演进
发布时间:2026-08-06 09:55 浏览量:3
在信息技术方向中设置了“虚拟现实”(VR/AR/MR)技术专题。
(
映维网Nweon 2026年08月06日
)工业和信息化部等七部门办公厅(办公室)日前联合印发通知,部署开展2026年工业和信息化领域创新任务揭榜挂帅工作,加快推动科技创新与产业创新深度融合,以关键技术攻关推动产业高质量发展。其中,在信息技术方向中设置了“虚拟现实”(VR/AR/MR)技术专题。
面向参与揭榜的如下七类虚拟现实优秀项目,后续拟开展相关供需对接与技术生态培育工作。一是,积极开展宣传推广。借助活动平台开展应用展示、供需对接等后续公共服务工作。二是,支持开展技术创新与规模应用。对应用成果突出的优秀项目,支持开展技术应用试点与测评,助力融合应用推广。三是,引导各类要素支持。对应用成果突出、具有复制推广价值的项目,推动电子信息产教、产融等社会组织做好人才、资金等要素支持。
一、 总体发展情况
过去十余年,XR产业经历了从消费电子和移动互联网驱动,到产品试错和应用探索,再到AI与XR双轮驱动的阶段转换。当前真正值得关注的变化,不是又出现了一批更高分辨率的头显或更轻的眼镜,而是XR正在从“显示和交互设备”升级为连接现实世界、数字内容与人工智能的新型空间计算平台。空间计算也由“记录空间、进入空间”,进一步走向“理解空间、推理空间并在空间中执行任务”。
本次XR创新技术解决方向征集设置的7个领域,表面上分别涉及沉浸视频、空间计算平台、AI+AR眼镜、VR大空间、三维重建、端侧空间智能和人因评价,实际上共同构成了一条完整的产业链和能力闭环:三维沉浸视频解决“拍得出、传得动、播得好”的内容问题;消费级三维重建解决“低门槛把现实变成3D资产”的生产问题;高精动态AI+AR空间计算平台解决“定得准、锚得住、持续更新”的空间基础设施问题;端侧空间智能解决“看得懂、记得住、能规划、会执行”的智能问题;轻量化AI+AR眼镜解决“戴得住、用得久、服务随身”的终端入口问题;VR大空间解决“多人同时跑得稳、长期运营能复制”的场景落地问题;人因功效与体验优化系统则解决“效果测得清、原因找得到、体验能改进”的评价闭环问题。
七大XR揭榜方向总结起来就是:拍得出、建得快、定得准、戴得住、跑得稳、懂得深、测得清。
任务1:三维沉浸视频生产系统——让XR从“有设备”走向“有内容可看”
【一句话解读】三维沉浸视频不是把二维视频简单做成立体版,而是重新组织采集、制作、编码、传输、渲染、播放和质量评价全链条。
发展背景
长期以来,XR产业面临一个典型矛盾:终端性能不断提升,真正能够体现终端价值的三维原生内容却相对不足。用户购买了可以显示立体影像、支持头部转动甚至位置移动的设备,但大量内容仍然是把二维视频放到虚拟大屏上播放。终端已经进入空间,内容却仍停留在平面。
三维沉浸视听正在形成由浅入深的内容谱系。第一类是手机拍摄的空间照片、空间视频,主要提供双目立体感;第二类是用户可以转头观看的180°或360°三维沉浸视频;第三类是允许用户在一定范围内移动视点、从不同角度观察场景的体积视频和6DoF内容。内容形态也因此从“视频文件”逐步走向“空间资产”和“可运行场景”。目前,专业采集、编辑和发行工具链正在加速成熟。Apple与Blackmagic围绕Apple Immersive Video形成了从专业相机采集到DaVinci Resolve编辑、调色、混音和交付的制作链路,说明三维沉浸视频正在由少数实验室项目进入专业影视工业体系。
揭榜指南重点解决什么
本方向要求围绕立体全景增强、高效全景映射、多视角编码、跨终端转码、端云低时延传输、低抖动播放以及光场声场协同采集等技术,形成三维原生沉浸视频生产、分发、播放和测试验证一体化系统,相关任务目标传递如下信号。
第一,申报对象不能只是“一台相机”。相机采得好,但后期无法高效处理、编码传输成本过高、终端播放出现黑边、卡顿或者视差不适,仍然不能构成完整解决方案。
第二,申报对象不能只是“一种编码算法”。编码效率固然重要,但最终还要回答不同终端如何解码、视场切换如何处理、端到端时延如何测量、网络抖动如何掩蔽以及音画和空间声场如何同步。
第三,申报对象不能只有“技术样片”。指南明确提出行业应用和用户播放量,说明优秀案例应当同时具备内容生产能力、分发渠道、终端覆盖能力和持续运营机制。
高质量申报可明确给出完整业务链路:采用什么方式采集,如何完成双目标定和多机同步,如何剪辑与编码,采用什么网络和分发架构,支持哪些终端,如何进行播放质量测试,最终由谁生产内容、通过什么平台触达用户。
值得关注的相关发展趋势是什么
未来两年,三维沉浸视频将沿三条路线并行发展。个人用户侧,手机和消费级相机将降低空间照片、双目视频和轻量全景内容的生产门槛;专业内容侧,体育赛事、演唱会、纪录片和影视内容将推动高规格三维沉浸制播;交互内容侧,体积视频、神经重建和数字人技术将推动视频从3DoF观看走向6DoF交互。
编码和传输也将从“整帧传输”走向“视点相关传输”。系统不再需要无差别传送用户看不到的全部空间数据,而是根据头部姿态、注视方向、网络状态和终端能力动态组织内容。与此同时,质量评价将由传统的清晰度、码率和卡顿指标,进一步扩展到双目一致性、视差舒适度、空间声像匹配、视点切换稳定性、黑边和拼接缝等XR特有指标。
任务2:高精动态AI+AR空间计算平台——让数字内容真正“钉”在现实世界
【一句话解读】传统定位回答“设备现在在哪里”,空间计算平台还要回答“这里是什么、与哪些对象和服务相关、环境发生了什么变化”。
发展背景
GPS可以提供室外粗粒度位置,却难以满足室内、城市峡谷和高精AR需求。SLAM能够完成局部定位与建图,但长期运行容易产生漂移,跨会话、跨设备和多人共享时还需要统一空间坐标。真正面向规模化应用的平台,需要将局部SLAM、广域VPS、三维地图、语义标签、空间锚点、动态状态和云端更新组织成一个持续运行的空间索引系统。因此,“定位”正在从一个坐标值升级为一组可调用的空间信息:统一坐标、三维几何、语义标签、空间锚点和场景状态。例如,Niantic Spatial对VPS的官方定义也体现了这一变化:系统不仅确定设备相对于地图的六自由度位姿,还用于把持久数字对象稳定地绑定在现实世界中。
揭榜指南重点解决什么
本方向要求融合SLAM、VPS与AI感知,实现高精定位、快速初始化、稳定重定位和多终端空间同步;同时研究地图预建、语义融合、众包采集、动态更新、地图资产管理、AR内容开发、端云渲染和智能交互。
这意味着本方向不能简单等同于“升级一个SLAM算法”。平台必须同时具备建图、定位、更新、管理、开发、部署和服务能力。一张静态地图只能证明“建出来了”,动态地图才能证明“长期可用”。申报方案需要说明地图如何采集,坐标如何统一,对象身份如何保持一致,场景变化如何发现,旧版本如何失效,众包数据如何审核,不同终端如何共享锚点,地图和语义资产如何进行权限管理。
优秀项目应当提供可持续运行的平台架构,而不是一次性的场景工程。建议明确展示“采集—重建—定位—语义—锚定—内容部署—动态更新—运营管理”的完整链路,并说明地图更新频率、冷启动成功率、跨设备一致性、服务可用性和数据权限机制。
值得关注的相关发展趋势是什么
第一,空间地图正在形成“公共全球图+企业私有图”的双层结构。公共地图负责跨区域连接、基础场所识别和开发者入口,私有地图负责工厂、园区、商业综合体、博物馆、医院等重点场所的高精建图、对象管理和状态更新。
第二,端侧实时建图与云端预建地图将长期共存。端侧负责快速感知局部变化、应对临时环境和保护敏感数据,云端负责大尺度地图管理、跨终端共享和持续更新。
第三,地图输出将由“坐标和点云”升级为“可查询的场景知识”。开发者和AI助手不仅要知道用户位于某个坐标,还要知道用户面前是什么设备、哪个入口可以通行、某个展品正在举办什么活动以及某个工业部件是否处于异常状态。
第四,地图平台将越来越强调Agent接口。未来的空间Agent不是打开地图查看位置,而是直接提出“带我去最近的出口”等任务,由系统调用定位、地图、搜索和内容服务完成执行。
任务3:轻量化高性能AI+AR眼镜——从“把屏幕装进眼镜”走向“把AI带进日常生活”
【一句话解读】AI+AR眼镜的难点不在于某一个参数做到极致,而在于让显示、光学、芯片、传感、算法、电池和佩戴体验同时达到可用平衡。。
发展背景
VR/MR头显长期沿“加法路线”发展:增加摄像头、提高分辨率、扩大算力、强化交互,整机能力越来越强,但功耗也较高。AI+AR眼镜则沿“减法路线”前进:先把头显压缩为日常眼镜形态,再在极其有限的重量、功耗、散热和镜腿空间中逐步增加显示、感知和AI能力。当前,眼镜形态已经由无显示音频和拍摄眼镜,向带显示的AI眼镜继续演进。Meta在2025年推出带全彩显示和肌电腕带交互的Meta Ray-Ban Display,显示、AI助手和低摩擦交互开始进入相对日常化的眼镜产品。
揭榜指南重点解决什么
本方向要求研究新材料、微显示光机、光波导、镜片一体化、电致变色、屈光矫正、智能音频、第一视角拍摄、手眼交互和端云协同多模态智能体。其中,预期目标中的70克、1瓦和30°视场角不是彼此独立的指标,而是对整机协同设计能力的综合检验。视场角扩大通常会增加光机体积和功耗;显示亮度提高会带来发热和续航压力;摄像头和传感器增加会抬高重量、功耗和隐私风险;本地模型增强会增加芯片负载,全部依赖云端又难以保证时延和连续服务。
本方向考察的是“整机平衡”,而不是单项冠军。优秀项目不只展示光机模组、眼镜外观或者一个大模型问答Demo,而应说明功耗分布、热设计、重量分布、光学指标、户外可读性、语音和视觉链路时延、端云任务划分以及应用适配机制。
值得关注的相关发展趋势是什么
显示侧,低成本、低功耗、高亮度微显示仍是核心。Micro-LED具有高亮度和高能效潜力,但全彩化、良率和成本仍需持续突破;LCoS和硅基OLED则将在不同产品定位中继续发挥作用。
光学侧,光波导是眼镜轻薄化的关键方向,但阵列光波导、表面浮雕衍射光波导和体全息波导仍处于多路线竞争阶段。产业关注点已不只是“能不能显示”,而是透光率、光效、视场角、眼动范围、彩虹纹、鬼影、漏光、良率和成本的综合平衡。
镜片侧,屈光矫正、电致变色、环境光适配和普通眼镜外观将成为影响用户长期佩戴的重要因素。未来真正进入大众生活的AI+AR眼镜,不能要求用户在功能眼镜和近视眼镜之间二选一。
交互侧,语音仍是重要入口,但不会是唯一入口。眼动、头动、触控、手势、肌电以及系统对当前情境的理解,将共同降低用户频繁唤醒、重复描述和手动选择的操作成本。
智能侧,端云协同将成为主要架构。端侧承担唤醒、语音前处理、基础识别、敏感数据处理和低时延交互,手机或计算盒子承担中等算力任务,云端承担大模型推理、知识检索和复杂服务。
任务4:高沉浸舒适性虚拟现实大空间系统——从“一次性打卡项目”走向可复制、可运营的线下新型消费场景
【一句话解读】XR大空间的核心不是把场地做得更大,而是让多人体验在复杂内容、高并发和长期运营条件下依然稳定、安全、舒适。
发展背景
VR大空间的核心不是把场地做得更大,而是让多人体验在复杂内容、高并发和长期运营条件下依然稳定、安全、舒适。VR大空间把家庭设备难以提供的自由行走、多人同场、全身参与和场景化沉浸带入线下场所,是当前较具商业闭环潜力的XR应用形态之一。但从一次体验到长期运营,中间存在明显的工程鸿沟。一个项目在演示时运行30分钟并不困难,难的是每天连续运营数小时,面对不同身高、年龄、步态和设备使用习惯的用户,仍能保持定位稳定、设备同步、网络低时延、画面不卡顿、人员不碰撞、内容不中断。更加困难的是,系统还要支持快速开场、设备消毒、故障替换、人员培训、票务管理和不同场地复制。
2025年,国家电影局将虚拟现实电影纳入规范化管理和扶持体系。到2026年4月17日,全国已有超过220部虚拟现实影片申报备案,39部作品取得公映许可,产业开始由项目探索进入规范化发行和运营阶段。
揭榜指南重点解决什么
本方向要求研究多人同场体验、状态同步、安全避障、实时渲染负载分析、帧时序优化、图形资源调度、自适应渲染、本地与边缘渲染、无线串流、多源追踪、多感官反馈、自然交互和舒适性调控。这些指标说明,系统既要解决单用户画质,也要解决多用户并发;既要解决技术体验,也要解决场所运营;既要追求沉浸,也要具备安全边界。
优秀项目可同时提供技术指标和运营指标。除了帧率、时延、定位误差和并发人数,还应说明单场准备时间、设备周转效率、故障恢复时间、现场人员配置、单位面积吞吐能力、连续运行时长和用户不适退出率。
值得关注的相关发展趋势是什么
一是,渲染架构将从单一模式走向本地、边缘和无线串流混合部署。不同场所的面积、网络、终端和内容复杂度不同,平台需要根据实际情况动态选择渲染与传输策略。
二是,图形优化将由人工经验调参走向自动化性能分析。系统应能够识别GPU瓶颈、帧时序异常、资源加载峰值和多人同屏复杂度,并动态调整分辨率、阴影、特效、模型细节和注视区域质量。
三是,追踪定位将由“设备能定位”升级为“多人连续稳定运行”。除了平均误差,还要关注漂移、遮挡恢复、地图切换、设备重启、异常掉线和快速重定位。
四是,交互设计将从“看一场三维电影”逐步走向更深的任务参与。国内不少项目仍偏重沉浸观赏展示,未来可提高用户选择、协作、探索和剧情反馈能力,增强复购率和停留价值。
任务5:消费级终端三维场景重建与交互系统——让普通手机也能成为现实世界的“3D扫描入口”
【一句话解读】并非一味追求做出一段漂亮的三维漫游视频,而是把现实环境转化为几何可信、外观真实、可以编辑、可以分发、可以交互的三维资产。
发展背景
三维内容生产成本一直是XR规模发展的关键瓶颈。传统三维建模依赖专业摄影测量、激光扫描、建模师和美术师,生产周期长、成本高,难以支撑海量文旅空间、商品展厅、住宅、商铺和工业现场快速数字化。
近年来,三维重建形成了多条技术路线。传统SfM、MVS和COLMAP擅长恢复几何结构与相机关系;NeRF和3D Gaussian Splatting更强调从新视角看起来真实;以VGGT为代表的前馈式几何基础模型,则尝试在一次推理中同时输出相机参数、深度、Point Map和三维点跟踪,把原本分散的几何任务整合进统一模型。这并不意味着某种新技术会完全替代旧技术。更现实的产业路线是分层协同。
揭榜指南重点解决什么
本方向要求面向手机和XR终端,研究多角度照片、视频和端侧传感数据驱动的低门槛采集与端云协同重建,融合多视图几何、神经渲染、点云或高斯表示和AIGC辅助建模,同时解决三维资产轻量化、压缩、跨平台分发和浏览适配问题。
优秀的项目应提供多种真实环境测试,而不能只展示纹理丰富、光照稳定的物体/场景。例如,覆盖弱纹理墙面、玻璃反射、重复结构、室内外光照变化、狭窄空间和不同终端型号。
值得关注的相关发展趋势是什么
第一,三维重建将由专业设备主导走向消费级终端普及。手机摄像头、IMU、深度传感器和端侧AI能力持续增强,为普通用户完成空间采集提供了基础。
第二,重建目标将从“生成一个模型”转向“生成可用资产”。资产要能够裁剪、标注、编辑、压缩、加载、碰撞检测和语义检索,最终进入Unity、Unreal、Web端、手机端和XR应用。
第三,几何与渲染将进一步融合。用于测量、碰撞和定位的几何表示,与用于高保真观看的外观表示可以分层存在,但应通过统一坐标和对象身份关联。
第四,3D资产将逐步带上语义。系统不仅生成墙、地面和家具的形状,还应逐步识别对象类别、空间关系、可交互区域和场所功能,为AR内容部署和空间智能提供基础。
任务6:面向XR设备的端侧空间智能系统——从“看见世界”走向“记住、理解并完成任务”
【一句话解读】核心不仅仅在于在眼镜上接入一个大模型,而是让模型真正获得空间上下文、持续记忆和任务执行能力。
发展背景
传统AI助手主要处理文本、语音和二维图像。XR设备则持续获取第一视角视频、深度、位姿、头手眼状态和空间地图,这使AI第一次有机会理解“用户—对象—环境”之间的三维关系。其中,有两点值得关注。其一是空间数据,没有带位姿、深度、对象、关系、行为和任务结果的第一人称数据,空间智能难以训练和客观评价。其二是模型参数,并非盲目追求参数规模,而是考察模型压缩、算子优化、内存管理、端云切分、时延控制和功耗控制等模型工程能力。
揭榜指南重点解决什么
本方向要求研究第一人称多模态感知、6DoF定位、三维几何—语义地图协同构建、空间实体识别、跨会话空间锚定、场景更新、空间关系表达、空间记忆、任务规划、端云协同推理,以及第一人称空间数据的采集、标注、脱敏和基准构建。
高质量项目不能只展示普通视觉问答Demo可以识别桌上有什么,可至少展示一类完整空间任务链。同时,可明确数据脱敏、旁观者保护、位置与地图权限、记忆删除、模型置信度和高风险行动确认机制。
值得关注的相关发展趋势是什么
几何表示正在向语言和模型友好的场景表示演进。Meta SceneScript尝试把场景结构表达为一系列结构化语言命令,使模型可以用接近“读脚本”的方式理解墙体、门、家具和空间关系。
XR平台中的AI也开始从问答走向行动。Android XR官方资料明确提出,Gemini不仅帮助用户理解正在看到的内容,也可以代表用户采取行动,这反映出“视野理解+工具调用+任务执行”正在成为空间操作系统的重要能力。
第一人称数据还在向具身智能训练外溢。EgoMimic利用Project Aria眼镜采集人的第一视角操作数据,并与机器人数据联合训练操作策略,说明XR设备未来不仅是消费终端,也可能成为采集人类行为和空间操作数据的重要工具。
自然交互也将由“用户明确说出每一步”转向“系统理解共同注意和当前情境”。当用户看向某个设备并说“这个怎么处理”时,系统需要结合注视对象、设备状态、历史任务和用户权限理解“这个”具体指什么,而不是要求用户重新描述设备名称和位置。附件2将其概括为低摩擦的注意力—情境感知空间交互。
任务7:面向XR多场景应用的人因功效与体验优化系统——把“好不好用”从主观感受变成可测量、可比较、可优化的工程指标
【一句话解读】人因评价不是产品做完之后再发一份问卷,而应当进入需求、设计、测试、诊断和优化全过程。
发展背景
XR设备直接作用于人的视觉、听觉、前庭感觉、注意力和动作系统。传统手机应用出现卡顿,用户可能只是感到不耐烦;XR系统出现定位漂移、视差异常、画面时延或交互误判,则可能引发眩晕、疲劳、碰撞风险和认知负担。与此同时,不同XR场景对体验的要求并不相同。文旅大空间强调沉浸感、舒适性和安全通行;工业辅助强调任务准确率、操作效率和错误控制;教育培训强调知识掌握、认知负荷和技能迁移;AI眼镜强调长时佩戴、注意力打扰、隐私感受和社会接受度。
因此,XR人因系统不能只有一套通用问卷,而需要将设备状态、内容事件、用户行为、生理信号、主观评价和任务结果放在统一时间轴上,解释“用户在什么时刻出现了什么问题,问题由哪个系统环节引发,优化后是否真正改善”。
揭榜指南重点解决什么
本方向要求研究人因数据同步采集与语义对齐,把终端状态、交互行为和体验结果关联起来;建立舒适性、安全可靠、认知效率和沉浸体验等多维评价模型;建设可配置的测试流程、可复用任务模板和体验优化闭环。
高质量方案应当回答四个问题:测什么、怎么测、为什么出现问题、怎样形成优化闭环。“测什么”需要根据场景建立指标模型,而不是无差别采集所有传感数据;“怎么测”需要明确统一时钟、事件标记、采样频率、实验任务和通过标准;“为什么出现问题”需要把主观反馈、任务结果和终端日志关联起来;“怎样优化”需要输出内容、交互、硬件、网络或运营流程的具体改进建议,并通过复测证明效果。
值得关注的相关发展趋势是什么
第一,评价对象正在从单机参数扩展到端到端体验。显示分辨率很高,并不代表用户一定看得舒适;定位误差平均值较低,也不代表关键交互时刻不会发生跳变。评价必须覆盖设备、网络、内容、交互和用户任务全过程。
第二,评价方法正在从结果打分走向过程诊断。系统不仅要知道用户最终是否完成任务,还要记录在哪一步犹豫、何时重复操作、何时视线偏离目标、何时出现生理应激,以及这些事件与帧率、时延、定位或内容变化是否同步。
第三,主观和客观数据需要相互校验。问卷可以解释用户感受,眼动可以反映注意分配,姿态和步态可以反映行为变化,心率、皮电等指标可以辅助分析唤醒和压力水平,但任何单一信号都不能直接等同于“体验好”。
附:XR揭榜挂帅原文工信部网站链接(见附件3信息技术方向专题五虚拟现实)