Workflow
HRM²Avatar
icon
搜索文档
SIGGRAPH Asia 2025 | 只用一部手机创建和渲染高质量3D数字人
机器之心· 2025-12-18 10:15
行业技术地位与团队里程碑 - 公司团队的研究成果首次登录国际顶级计算机图形学会议SIGGRAPH Asia,这代表了学术与工业界的最高研究水平与最前沿技术趋势 [2][5] - 团队在3D、XR、3D真人数字人和三维重建等方向拥有深厚技术积累,此前已在CVPR 2025会议上作为Highlight Paper发表了TaoAvatar,并在淘宝未来旗舰店实现了业内首个3D真人导购体验 [4] 核心技术方案:HRM²Avatar - 系统目标是通过手机单目视频生成高保真且可实时驱动的3D数字人,旨在解决普通人使用门槛高的问题 [6][10] - 核心采用两阶段采集方式、显式衣物网格表示与基于高斯的动态细节建模,并结合面向移动端的高效渲染优化策略 [12] - 系统采用显式服装网格与高斯表示相结合的建模方式:网格提供稳定结构与可控性,高斯用于呈现褶皱、材质和光照变化等细节 [6] - 基于轻量化推理设计与移动端渲染优化策略,生成的数字人可在手机、头显等移动设备上流畅运行 [6] 系统流程与关键技术模块 - **采集与预处理**:采用双序列拍摄方式,包括静态扫描(用于获取全身结构和局部纹理)和动态扫描(用于捕捉衣物褶皱和光照响应),无需额外硬件 [18] - **服饰网格提取**:流程包括几何重建、服装区域提取、重拓扑与蒙皮绑定、绑定对齐,最终生成可绑定动画的穿衣人体网格作为几何基底 [31][32][33][34][35] - **实时可驱动的数字人重建**:着重从混合表示、几何生成、动态光照建模、训练流程、轻量网络蒸馏五个方面进行设计 [37] - **混合表示**:在穿衣人体网格的每个三角形上附着高斯点,构建混合数字人表征,为姿态相关的形变与光照建模提供可控参数空间 [40][43] - **几何生成**:最终几何基于带服饰的模板网格,并通过静态偏移、姿态相关偏移和逐帧残差三类偏移量组合得到 [46][47][51] - **动态光照建模**:引入轻量化的单通道姿态相关光照项,对高斯的外观属性进行调制,使数字人在不同姿态下保持自然的光照一致性 [53][54] - **训练流程**:同时使用近景与全身图像监督,优化策略包括颜色一致性监督、语义掩码约束、身体与服饰碰撞约束等 [57][67] - **轻量网络蒸馏**:训练一个轻量级预测网络,学习从姿态到几何形变与光照变化的映射,以支持移动端实时驱动,无需逐帧重建数据 [60] 移动端高性能实时渲染优化 - 对渲染阶段进行了系统性优化,包括层级裁剪、高效投影、量化排序和基于显卡硬件的加速渲染 [62] - **层级裁剪**:采用网格级视锥裁剪、三角片级背面裁剪、高斯级视锥裁剪三级策略,显著减少需渲染的高斯数量 [64][68] - **投影**:采用按需解码存储块的精简投影流程,有效降低解码带宽开销 [65][69] - **排序**:采用量化排序,将连续深度映射至紧凑区间,使用16Bit或12Bit深度存储,结合GPU并行Radix Sort加速,大幅减少排序负担和显存带宽使用 [70][73] - **渲染**:使用GPU硬件栅格化,并采用自适应面元缩放、基于透明度修剪、反向透明度估计等策略提升性能与视觉质量 [70][73] - 优化使系统采用紧凑、高度可并行、缓存友好的绘制方式,达成移动端实时表现 [71] 实验结果与性能表现 - **与现有方法对比**:在自构数据集上,HRM²Avatar在PSNR(26.70)、SSIM(0.963)、LPIPS(0.040)所有指标上均优于对比方法GaussianAvatar和ExAvatar [77] - 在Neuman数据集上评估泛化表现,模型在快速动作或大姿态变化下能保持稳定的外观呈现和服饰细节 [80][81] - **消融实验**:验证了显式服装网格、姿态相关的外表建模、两阶段扫描协议均为系统的必要设计模块,移除后会导致质量下降 [82][84] - **移动端性能**:在iPhone 15 Pro Max上,单个数字人(约53万高斯点)能以2K分辨率、120 FPS稳定运行;同时渲染三个数字人时可达到2K @30 FPS;在Apple Vision Pro上可实现2K@90 FPS实时渲染 [87] - 各渲染优化策略带来显著性能提升:分级裁剪提速1.83倍,按需解压缩提速1.93倍,深度量化排序提速1.99倍(基于iPhone 15 Pro Max测试数据) [88] 总结与展望 - HRM²Avatar是一项让普通人也能通过手机创建高质量数字人的前沿探索,为移动端数字人应用提供了可行技术路径 [91] - 当前技术对结构复杂或非固定拓扑的服饰重建精度,以及在极端光照或动态遮挡场景下的效果,仍有进一步优化空间 [91] - 该成果被视为推动数字人从专业设备走向普通用户、从实验室走向真实应用场景的一个重要里程碑 [91]