3D mesh重建002-text2meshCVPR2022将CLIP跨圈到mesh风格的生成
0 摘要
先上图!!! 直接上效果图和gif动态效果图!其中第一张图第一列是输入了一个人的mesh模型和一个iron Man的词条引导,然后生成的mesh就变成了钢铁侠。另外的gif图像展示的是同一个罐子的mesh结构在不同文本的控制下取得的不同效果。整体来说还是很惊艳,不得不由衷感叹万物皆可CLIP的感觉。


text2mesh论文发表在CVPR2022,是CLIP思想在三维内容风格控制上的工作扩展。文章的方法的输入是一个具体的mesh结构和一个文本提示,其中具体的mesh提供的风格化调整的基础结构,文本主要表征希望得到的图像风格,中间会训练一个用来表示mesh风格的神经风格场,这个结构应该是收到nerf的启发,然后借用了可微渲染把mesh渲染成图像,然后回到CLIP的领域进行相似度计算。论文展示的效果都挺好,一些简单测试样例效果都不错,但是使用CLIP的同时也带入了CLIP的局限。
1 论文整体结构
论文的整体结构就比较简单,如果你了解过001介绍的工作SMR等一系列基于可微分渲染的工作和CLIP论文。
论文链接
github链接
下面结合论文的整体结构概览图来简单分享以下这篇论文的主题工作。

1)首先,输入在左侧略框内,包含mesh结构和文本提示两个部分,当然论文也说了文本提示也已换成图像的纹理提示。
2)NSF部分,就是把mesh所有顶点坐标通过傅立叶函数映射到一个高维空间,然后输入到NSF网络,将mesh解耦称color的位移,实际上这块基本是就是NeRF的工作思想,然后重新替换掉原来的颜色和mesh信息。

text2mesh是2022年CVPR会议上的一项研究,它将CLIP模型扩展到3D内容风格控制。方法接收一个3D网格模型和文本提示,通过神经风格场对网格进行风格化,再利用可微渲染转化到2D图像并用CLIP评估与文本的相似度。实验展示了该方法在不同文本引导下的效果,但对输入网格结构有依赖,且对模糊语义的处理能力有限。

1万+

被折叠的 条评论
为什么被折叠?



