ECCV 2022 | 清华&腾讯AI Lab提出REALY: 重新思考3D人脸重建的评估方法

PCA(主成分分析)方法数据降维、重构和人脸识别 本文使用matlab采用PCA完成对数据的降维、重构和人脸识别。 参考文章:http://blog.csdn.net/watkinsong/article/details/38536463 我眼中的PCA: 数据的维数过高,处理起来耗时又费力,于是就在想我能不能只处理部分维数,并且得到的结果与全部维数的结果一致。当当当,PCA就出炉了。简单来说,就是一个图片有2000个特征维度,而实际上只有 阅读详情

原文链接: ECCV 2022 | 清华&腾讯AI Lab提出REALY: 重新思考3D人脸重建的评估方法
本文分享ECCV 2022论文《REALY: Rethinking the Evaluation of 3D Face Reconstruction》,对3D人脸重建的评估方法进行重新思考。该论文提出一个新的3D人脸重建的benchmark数据集,名为REALY benchmark,和相应的评估方法,能对于重建的3D人脸模型在不同脸部区域进行细粒度评价,并对于主流的单张照片3D人脸重建算法进行了详细的评测。另外,该论文同时公开了一个由近2000个人脸扫描模型构建的高质量全头模型3DMM基底:****HIFI3D++,该基底相对于BFM、FWH、FaceScape、FLAME、LSFM、LYHM等3DMM基底有更强的表达能力和更高的Mesh模型质量。相关代码和3DMM已开源。此项工作由清华大学与腾讯AI Lab合作完成。

图片

REALY: Rethinking the Evaluation of 3D Face Reconstruction
Zenghao Chai*, Haoxian Zhang*, Jing Ren, Di Kang, Zhengzhuo Xu, Xuefei Zhe, Chun Yuan, Linchao Bao
论文:https://arxiv.org/abs/2203.09729
代码:https://github.com/czh-98/REALY
项目网站:https://www.realy3dface.com/

一、简介

3D人脸重建历经多年发展,不同的重建方案层出不穷,然而对于不同方法重建结果的定量评价却存在明显的问题和缺陷,即客观指标与人的主观感受难以相符。

回顾先前的3D人脸重建评价方案,基于3D顶点的评价流程通常借助关键点进行scale和pose的预对齐,并通过Iterative Closest Point (ICP)算法进行微调使得predicted mesh和ground-truth scan对齐,再通过两者的最近邻点建立顶点的对应关系,并计算这组对应关系的NMSE/RMSE作为指标。

本文首先分析这样的评价流程存在的问题,揭示了先前的评价方案无法与主观评价相吻合的重要原因:_即全局的刚性对齐会受到脸部局部区域重建质量的影响,并且根据单方向距离(最近邻点)建立的对应关系无法保证顶点之间语义信息的一致性。_所以我们构建了REALY benchmark,设计了新的3D人脸重建评价方案,并对先前的模型和3DMM进行了重新的评价,验证了我们的评价流程的合理性。

此外,在构建新的benchmark的过程中,我们通过整合约2000个高质量的人脸scan数据,进行拓扑结构的统一,从而构建了一个新的具有高表达能力的3DMM,其拓扑结构、基的维度都要优于先前的3DMM,并在RGB-(D) Fitting的比较中证明其表达能力和重建效果。

二、论文动机

先前的评价方案存在以下两个主要问题。

  1. ICP对齐过程对局部区域的变化比较敏感。直观而言,对于两个完全重合的3D mesh,如果我们只对predicted mesh的鼻子区域进行修改,理想状况下,两个mesh对齐结果应该如中间所示,因为其他区域在改变前后与ground-truth是完全重合的,两者的误差应该主要集中在鼻子区域;而根据以往的评价流程,全局对齐操作则会由于鼻子区域的变化,导致对齐后mesh整体的位置发生偏移而带来误差的放大。对此,本文将人脸的评估分为四个区域,分别对每一个区域进行对齐、评估,而不考虑其他区域的影响。

图片

  1. 单向的最近邻点建立的对应关系容易导致语义信息的不一致。如图所示,对于predicted mesh上的某一点x,在计算误差时需要找到ground-truth scan上的对应点,若通过点到平面的最近距离建立对应关系,则可能为y1。这时,虽然y1是x距离最近的点,然而他们在语义信息上没有关联性,与嘴角的点x相关联的应该是y2,然而y2不会是x所对应的最近点。在这样的情况下,虽然计算得到的误差较小,但由于对应点之间的语义信息并不一致,因此计算得到的误差并不靠谱,较小的误差并不能表明较大的相似度。对此我们提出使用一步额外反方向非刚性对齐,并且其中增加了包含有语义信息的关键点损失,从而得到语义上更加一致的对应关系。

图片

三、REALY

为了解决上述两个问题,我们首先构建了一个新的benchmark,包含100个2D图片-3D scan对,其中每个scan渲染了5个不同视角下(包含1个正脸和4个侧脸)的RGB图片及深度图片;对于每个3D scan,我们都得到了语义信息一致的68个关键点以及不同脸部区域的mask,并在此基础上首次实现了3D人脸在不同区域上的细粒度评价。我们的benchmark的部分数据如下图所示。

图片

图片

数据集的构建过程借助256个关键点进行对齐和转拓扑,确保了统一拓扑的mesh的质量,进而保证了不同id的人脸区域的mask以及关键点的一致性。

图片

四、新的评价流程

在REALY的基础上,我们提出一个新的评价流程避免先前评价流程的问题,具体而言,我们的评价流程包含如下两个步骤:

  1. 局部区域的对齐:考虑到不同区域的重建质量会影响全局的对齐结果,由于我们的benchmark得到了不同脸部区域的mask,因此我们可以借助这个信息将predicted mesh对齐到ground-truth scan的特定区域,在error计算时只计算ground-truth scan上的特定区域与predicted mesh之间的误差,而不考虑脸部其他区域对于对齐结果以及误差计算的影响。

图片

  1. 对应关系的建立:在局部对齐的基础上,我们需要建立ground-truth scan某一区域上的每一个点与predicted mesh之间的对应点并计算两者的误差。考虑到先前基于最近点的方式存在的问题,我们提出一个新的对应关系的建立方法,提高了关键点语义信息的一致性。

具体而言,我们首先通过最近点建立初步的对应关系;随后借助non-rigid ICP将ground-truth scan某一区域变形到predicted mesh上,由于变形后的区域与predicted mesh已经贴合,因为在变形过程中考虑了具备语义信息的关键点损失,所以这时的对应关系相比于原始的最近点的对应关系具有更好的语义关系的一致性(如,图3中脸部关键点的一致性),从而我们对初始的对应关系进行更新;最后,由于变形前后的拓扑形状的一致性,我们能够借助更新后的对应关系计算原始的ground-truth scan区域与局部对齐的mesh之间的最终误差。

图片

通过本文提出的评价流程,我们能够建立语义信息更一致的对应关系,从而提升最终评价结果的可靠性。直观而言,如图所示,对于ground-truth scan嘴部区域的关键点,我们分别比较了predicted mesh使用先前的对齐方法(gICP),以及本文提出的基于区域的对齐方法(rICP)以及基于形变的关键点更新策略(bICP)在ground-truth scan上找到的对应点与真实的嘴部关键点的差异,可以发现,我们的方法建立的关键点与真实的关键点更加接近,因此这时的误差最能体现真实的相似性。

图片

五、新的人脸3DMM:HIFI3D++

在构建benchmark的过程中,我们对于一些高质量的人脸数据(Headspace, FaceScape, HIFI3D)进行了拓扑结构的统一,得到了约2000个不同性别、年龄、种族的人脸mesh,在此基础上,我们构建了一个全头人脸3DMM并命名为HIFI3D++,不仅包含脸部区域,还包含脖子、眼球、口腔,不同拓扑结构的比较如图1所示。

图片

表1统计了开源的3DMM与HIFI3D++的基本信息,图9则显示了不同3DMM的variation,我们的RGB(-D) Fitting实验也证明了HIFI3D++在表达能力上优于先前的3DMM。

图片

图片

六、实验

1. 评价方案有效性的证明

我们首先在toy数据上证明我们的评价流程相较于先前的方法的优越性。通过替换一组统一拓扑人脸的不同区域,采用不同的评价流程进行对齐和对应关系的建立,比较了不同评价流程 i) 由于对齐导致的误差以及 ii) 建立的对应点与ground-truth真实对应点之间的误差,结果如图4和表2、3所示。

图片

图片

从图4来看,全局的对齐策略(右图)由于局部区域的改变容易导致全局误差的变化,而我们的对齐策略则只聚焦于特定区域(右图),其中对角线的error map表明误差较大的区域,而非对角线的error map的误差较小,对应没有发生变化的区域。从表2来看,我们的对齐结果通过ground-truth的对应点计算得到的误差与真实的误差更为接近,而全局的对齐策略则导致误差与真实误差不匹配。从表3来看,我们的对应点计算策略带来的误差要显著小于全局对齐后最近点获得的对应点。实验结果表明,我们的评价流程不仅能够聚焦到脸部区域有差异的部分(图4和表2的对角线),并且我们的对应关系建立更加准确(表3)。

2. 不同方法在REALY benchmark上的表现

我们对比了先前的评价流程与我们提出的评价流程在REALY benchmark上的表现。对于先前的评价方法,我们从两个方向(即ground-truth scan的每个点与predicted mesh建立对应关系,以及predicted mesh每个点与ground-truth scan建立对应关系)作为对比,定量与定性的比较如表4和图5所示。

图片

图片

我们通过user study投票选出各组最好(*)/次好(†)的人脸,通过比较不同评价流程选出的最好的人脸(橙、蓝、紫框)可以发现,我们的评价流程(橙框)选出的最好的人脸与user study的投票结果匹配程度更高。并且,我们的评价流程给出了细粒度的评测结果,即:对不同的人脸区域都能进行定量的评价和比较。

3. 不同3DMM在REALY上的表现

借助REALY benchmark,本文采用RGB(-D) Fitting的方式对不同3DMM的表达能力进行了评价,定量与定性的比较如表5和图8所示。

图片

图片

定量和定性的结果表明,我们的3DMM在REALY上取得了更优的重建效果,并且,通过不同方法的比较表明,RGB-D Fitting的结果要显著优于目前最好的重建算法,3D人脸重建任务仍有很大的提升空间。

为了进一步证明HIFI3D++的表达能力,我们只用顶点损失,根据最小二乘的方式拟合一组mesh,对HIFI3D/HIFI3D(A)/HIFI3D++进行比较,如图9所示。

图片

七、总结

本文是我们对3D人脸重建评价的重新思考和探索。针对先前的评价指标无法准确衡量重建mesh与ground-truth相似性的问题,我们构建了一个新的数据集——REALY,包含更加丰富以及高质量的脸部区域信息,并借助新的评价流程对先前的数十个重建算法、3DMM进行了评价。

独家重磅课程官网:cvlife.net

图片

全国最大的机器人SLAM开发者社区

图片

— 版权声明 —

本公众号原创内容版权属计算机视觉life所有;从公开渠道收集、整理及授权转载的非原创文字、图片和音视频资料,版权属原作者。如果侵权,请联系我们,会及时删除

【电击防护篇】电击防护技术详解:从人体效应到接地系统全解析 本文系统讲解了电击防护的关键知识,包括电流对人体的影响(如30mA是心室颤动阈值)、人体电阻特性(700Ω-6100Ω)以及电气接触防护措施。重点分析了TT、TN和IT三大接地系统的结构特点与应用场景,强调TN-S系统最安全,IT系统供电连续性最佳。详细介绍了漏电保护器(RCD)的工作原理与选型指南,建议人身防护选用30mA高灵敏度RCD。文章通过对比表总结三大系统的安全性、成本及适用场景,为电气安全设计提供实用参考。 阅读详情

相关推荐

iPhone免越狱Git服务器搭建教程-iSH

iPhone免越狱Git服务器搭建教程

jts666的博客 4388

Sparse Local Patch Transformer预测人脸关键点坐标及内在关系 【CVPR 2022]

目前人脸对齐的方法已经取得很好的精度,但是大姿态、重度遮挡、光照变化的情况仍不能够被很好的处理。人脸的面部具有一个regular structure(规则结构),也就是面部地标之间的内在关系,这在人脸对齐中起着重要的作用。虽然近年来热力图回归方法占据了人脸对齐区域的主导地位,但是基于热力图的方法有两点缺陷(原文+自己总结): 热力图回归的方式由于是单独回归每张关键点的热力图,所以在预测时缺失了关键点之间的内在关系; 从热力图到关键点坐标值是往往采取argmax来获取热力图中最大峰值坐标,由于这一步是不可微.

Iron_lyk Blog 1821

AI黑话日日新】Day 010|System Prompt(系统提示词)

系统提示词不是给模型加能力的咒语,而是开发者写下的“行为宪法”——它定身份、划红线、约格式,但终究要配护栏才站得住。

专注:太空算力、AI infra、异构调度、大模型成本工程 299

ECCV 2022 | 清华&腾讯AI Lab提出REALY重新思考3D人脸重建评估方法

©作者 | 人脸人体重建来源 | 人脸人体重建本文分享 ECCV 2022 论文《REALY: Rethinking the Evaluation of 3D Face Reconstruction》,对 3D 人脸重建评估方法进行重新思考。该论文提出一个新的 3D 人脸重建的 benchmark 数据集,名为 REALY benchmark,和相应的评估方法,能对于重...

Paper weekly 669

ECCV 2022 | 清华&腾讯AI Lab提出REALY: 重新思考3D人脸重建评估方法

点击下方卡片,关注“CVer”公众号AI/CV重磅干货,第一时间送达点击进入—>CV微信技术交流群本文分享ECCV 2022论文《REALY: Rethinking the Evaluation of 3D Face Reconstruction》,对3D人脸重建评估方法进行重新思考。该论文提出一个新的3D人脸重建的benchmark数据集,名为REALY b...

阿木寺的博客 649

WAIC论坛现场|网易智企分享企业AI“上岗之路“

在世界人工智能大会(WAIC)2026上,网易智企举办了"用可信AI构建企业新智生产力"专题论坛。会上,网易智企副总经理段毓铮带来了题为《从能聊、到能干、到越干越好:企业AI的上岗之路》的演讲,抛出了一个核心观点:不把AI当工具,而是当作"AI员工"来看待。

weixin_43099039的博客 195

如何借助 AI 实现自动化测试:让 Agent 帮你写测试、跑测试、修测试

上下文工程优先:维护(页面结构、账号、业务规则),AI 输出质量立竿见影;AI 生成 + 人审 + 入库:测试代码是资产,必须 code review,禁止「AI 跑完就当真」;定位器纪律:全程getByRolegetByLabel,从源头减少失效;分层使用:单元/接口测试用传统框架,UI 探索性测试用 Agent,回归用固化脚本;成本控制:批量生成用便宜模型(DeepSeek / 本地 Ollama),关键修复用强模型;安全红线:测试 Agent 只能连测试环境;

篮球界最会写bug的人;程序猿中打球最菜的人。 396

83.85% vs 17.91%:FormStruct-Bench 揭开表单解析的错觉

文章摘要 FormStruct-Bench论文提出了一个针对表单类文档结构识别的新型分层评测基准,解决了传统方法在结构化评估上的不足。研究团队通过"导演-美术-质检"的合成流程构建了7,000个带精确标注的表单实例,并设计了分层评估指标,包括内容读取(Value-nED)、结构重建(Schema-nED)和路径正确率(TSR-path)等。实验结果显示,当前最佳系统在内容读取上达到83.85%,但结构路径正确率仅17.91%,区域检测和关系识别指标更低。研究表明,视觉退化主要影响结构绑定而非内容识别,且合成

liferecords的博客 505

Alexa Fluor568标记豌豆凝集素,适配多色荧光成像体系的橙红通道标记需求

AF 568 PSA是将Alexa Fluor568橙红荧光基团与豌豆凝集素(Pisum sativum agglutinin,PSA)定向偶联制备的糖链靶向特异性荧光探针,完整保留豌豆凝集素对α-甘露糖、α-葡萄糖的高亲和力识别特性,依托Alexa Fluor568染料优异的光学性能,在578nm处呈现明亮的橙红特征发射荧光,荧光亮度高、抗光漂白性能优异,是多色荧光标记体系中橙红通道靶向标记α-甘露糖/α-葡萄糖糖链的经典科研工具。(上述信息均由陕西新研博美生物科技小编木木所整理)性能参数与核心优势‌。

2601_96201972的博客 312

工业级温控机组赋能数据中心与ICT基础设施低碳化运营

阿尔西在全球布局的三大制造基地为工业级温控机组的产能协同提供了坚实保障,各基地在工业冷水机、医疗制冷、3D打印技术、组装、钣金、焊接等环节形成专业化分工与技术互补。阿尔西集团凭借近三十年的技术积累,将工业级温控机组的应用边界从传统制造业拓展至超大规模数据中心、电信基础设施及边缘计算场景,为全球ICT行业提供从芯片级到系统级的全方位温控解决方案。包括针对边缘计算场景的水平式整装空调型工业级温控机组,以及适用于中大型数据中心的远程温控型工业级温控机组,制冷能力覆盖多种规格,在保证可靠性的同时实现高效运行。

Jay150124的博客 289

Qwen3.8双模型开源引爆AI新热潮

Hugging Face报告显示,2026年以来中国开源模型参数规模达7540亿至2.78万亿,远超美国同期的1300亿以下。Qwen已成为开源生态重要基础模型,衍生模型数量超15万个。阿里千问团队宣布Qwen3.8-27B正式开源,可在高端手机和消费级显卡流畅运行;同时首次开放Max级别旗舰模型Qwen3.8-2.4T-A95B权重,总参数2.4万亿,采用稀疏MoE架构。

AI时代,你可能就如黑客帝国的neo。用心理学第一性原理拆解产品设计。好奇心、多巴胺、信息缺口——理解这些,你也能做出让人停不下来的好产品。关注我,成为AI时代产品大脑。 306

AI网关和API网关区别在哪?MAI Gateway统一治理方案深度解析

API网关转发请求,不关心内容。AI网关处理消费,不只转发。这是两类网关的根本区别。调用方不需要知道服务在哪,网关负责路由。请求体内容在网关层透传,网关不碰。企业要知道AI调用的内容安不安全、花了多少钱、归谁的部门、模型说了什么。请求体内容在网关层被检查、脱敏、计费、记录。差异的根源在于:大模型调用是按次消费,每次调用花钱;传统API调用是基础设施服务,部署了就能用。

youdiyunan的博客 282

FunASR 语音识别本地部署实录(下):34 分钟录音实测,踩过的坑、上线前要补的事

自建语音转写,门槛不高,但要做得稳,坑都在细节里。我实测下来的结论:环境坑比模型坑多,官方标了"生产验证"的路径可以放心走,但认证、限流、监控这三件事,官方明确留给你自己补,别指望示例代码替你解决。再说句心里话:自建最值钱的不是省下的服务费,是我想要什么能力都能自己加,不用求人。转写量大、音频敏感的朋友,值得自己搭一套;偶尔用几回的,云 API 更省心。觉得有用的话,顺手点个关注,后面我会继续写本地 AI 服务落地的实测。【欢迎访问我的个人博客主页,这里有我的精选文章和AI大模型日报专栏。👇)本文用到。

qq_31429225的博客 403

AI编程实战:让 AI 写测试,一次到位

本文介绍如何利用AI生成高质量的Python单元测试(以pytest为例)。关键步骤包括:1)使用结构化Prompt模板指定测试要求;2)通过三类输入(正常、边界、异常)确保覆盖全面;3)采用"改坏代码"法验证测试有效性。文章强调测试需满足:断言具体、行为导向、能捕获错误。文末提供实践作业,并预告下期将探讨AI生成文档的技术。全文150字,完整呈现AI测试生成的核心方法论。

用沸腾的热血,支付我们的人生吧! 256

AI Agent 技术架构深度解析与选型指南

AI Agent代表了企业AI应用从"问答"到"任务执行"的关键跃迁,也为管理软件行业带来了新的产品可能性。用友YonClaw、金蝶灵基等企业级AI Agent产品的推出,标志着国产管理软件在AI Agent方向的正式布局。对于企业而言,理解AI Agent的技术架构与能力边界,是做出正确选型决策的基础。本文面向技术架构人员与IT管理者,供技术评估参考。

likeylau的博客 298

AI Gateway 与直连 LLM API 的应该怎么选,一篇文章说明白

引入 AI Gateway 作为所有 LLM 流量的统一入口。配置提供商凭证、路由规则和 Fallback 链。在这个阶段,ServBay AI Gateway 的一键安装特性降低了不少门槛。相比 LiteLLM 等自托管方案需要 Python、PostgreSQL 和 YAML 配置文件的前置依赖,ServBay 用户只需要在应用内启用 AI Gateway 功能,像安装 PHP 或 MySQL 一样完成部署。网关已配置所有活跃的提供商渠道。只抽象新服务,遗留的老服务继续直连。

Sammyyyyy的博客 385

AI Agent 基础理解

文章摘要:本文解释了AI大模型的本质是基于文本输入输出的工具,自身不具备执行能力。通过引入Agent(智能体)概念,结合工具说明书和循环机制,模型可以间接完成复杂任务。详细演示了游客查询游玩路线的7步流程,包括前端请求、后端组装、模型工具调用与执行、结果返回等关键环节。重点强调了模型只负责自然语言处理,精确数据由后端直接控制的设计原则,确保系统可靠性。同时比较了手动操作与AI交互的两种实现路径及成本差异。

哆啦A梦的百宝袋的博客 314

python神经网络编程入门(三十七)——Decoder 内部——掩码自注意力与交叉注意力

上一章我们把编码器(Encoder)内部的"残差、LayerNorm、前馈"三块承重墙拆了个底朝天;这一章轮到另一半——解码器(Decoder)。解码器比编码器多两样东西:一张**"不许偷看未来"的掩码**,和一种**"去查编码器记忆"的交叉注意力**。文章先把这两样东西的来龙去脉讲透:为什么生成第 t 个词时不能看第 t+1 个词?那张"上三角遮罩"到底长什么样、为什么必须填 -1e9 而不是 0?交叉注意力里"解码器问、编码器答"的 Q/K/V 到底从哪来、为什么它们的长度可以不同?然后用 9 张图、若

qq_65148539的博客 859

技术拆解(十七)具身智能:机器人动作生成为何走向Diffusion Policy?

本文系统拆解Diffusion Policy的动作扩散、训练推理与滚动时域控制,并对比ACT和π0,厘清具身智能动作生成范式。

Zyzyzyzyzzzz的博客 407

SkillManager.zip_C++_class_skill_windows_wrotezeu

// Skill.h: interface for the CSkill class.// Skill.cpp: implementation of the CSkill class.// SkillHitBox.h: interface for the CSkillHitBox class.// SkillHitBox.cpp: implementation of the CSkillHitBox class.// SkillManager.h: interface for the CSkillManager class.// SkillManager.cpp: implementation of the CSkillManager class.

上一篇: SST-Calib:结合语义和VO进行时空同步校准的lidar-visual外参标定方法(ITSC 2022)
下一篇: ECCV2022解读:首篇基于环视相机的端到端自动驾驶框架!
计算机视觉life
博客等级 码龄12年 4318粉丝 · 209原创
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值