每日学术速递3.22

CV - 计算机视觉 |  ML - 机器学习 |  RL - 强化学习 | NLP 自然语言处理 

Subjects: cs.CV

1.DS-Fusion: Artistic Typography via Discriminated and Stylized Diffusion

标题:DS-Fusion:通过辨别和程式化扩散的艺术排版

作者:Maham Tanveer, Yizhi Wang, Ali Mahdavi-Amiri, Hao Zhang

文章链接:https://arxiv.org/abs/2303.09604

项目代码:https://ds-fusion.github.io/

摘要:

        我们介绍了一种新颖的方法,通过对一种或多种字母字体进行风格化来自动生成艺术排版,以直观地传达输入词的语义,同时确保输出保持可读性。为了解决我们手头任务的各种挑战,包括相互冲突的目标(艺术风格化与易读性)、缺乏基本事实和巨大的搜索空间,我们的方法利用大型语言模型来桥接文本和视觉图像以进行风格化,并建立一个无监督的具有扩散模型骨干的生成模型。具体来说,我们在潜在扩散模型 (LDM) 中使用去噪生成器,并关键添加了一个基于 CNN 的鉴别器,以将输入样式适应输入文本。鉴别器使用给定字母/单词字体的光栅化图像作为真实样本,并将去噪生成器的输出作为假样本。我们的模型被创造为 DS-Fusion,用于区分和程式化的扩散。我们通过大量示例、定性和定量评估以及消融研究展示了我们方法的质量和多功能性。用户研究与包括 CLIPDraw 和 DALL-E 2 在内的强基线以及艺术家制作的排版进行比较,证明了 DS-Fusion 的强大性能。

2.HIVE: Harnessing Human Feedback for Instructional Visual Editing

标题:HIVE:利用人类反馈进行教学视觉编辑

作者:Jiayu Jiao, Yu-Ming Tang, Kun-Yu Lin, Yipeng Gao, Jinhua Ma, YaoWei Wang, Wei-Shi Zheng

文章链接:https://arxiv.org/abs/2303.09618

摘要:

        结合人类反馈已被证明对于使大型语言模型生成的文本与人类偏好保持一致至关重要。我们假设最先进的教学图像编辑模型,其中输出是根据输入图像和编辑指令生成的,同样可以从人类反馈中受益,因为它们的输出可能不符合用户的正确指令和偏好.在本文中,我们提出了一个新的框架来利用人类反馈进行教学可视化编辑 (HIVE)。具体来说,我们收集人类对编辑图像的反馈,并学习奖励函数来捕捉潜在的用户偏好。然后,我们介绍了可扩展的扩散模型微调方法,该方法可以根据估计的奖励结合人类偏好。此外,为了减轻数据限制带来的偏差,我们贡献了一个新的 1M 训练数据集、一个用于奖励学习的 3.6K 奖励数据集和一个 1K 评估数据集,以提高教学图像编辑的性能。我们在定量和定性方面进行了广泛的实证实验,表明 HIVE 在很大程度上优于以前最先进的教学图像编辑方法。

3.FreeDoM: Training-Free Energy-Guided Conditional Diffusion Model

标题:FreeDoM:无训练能量引导条件扩散模型

作者:Jiwen Yu, Yinhuai Wang, Chen Zhao, Bernard Ghanem, Jian Zhang

文章链接:https://arxiv.org/abs/2302.01660v2

项目代码:https://github.com/ysig/learnable-typewriter

摘要:

        最近,条件扩散模型因其出色的生成能力而在众多应用中受到欢迎。然而,许多现有方法需要训练。他们需要训练一个依赖时间的分类器或一个依赖条件的分数估计器,这增加了构建条件扩散模型的成本,并且不方便在不同条件下迁移。目前的一些工作旨在通过提出免训练解决方案来克服这一限制,但大多数只能应用于特定类别的任务,而不适用于更一般的条件。在这项工作中,我们提出了一种用于各种条件的无训练条件扩散模型 (FreeDoM)。具体来说,我们利用现成的预训练网络(例如人脸检测模型)来构建与时间无关的能量函数,该函数无需训练即可指导生成过程。此外,由于能量函数的构建非常灵活并且适应各种条件,我们提出的 FreeDoM 比现有的免训练方法具有更广泛的应用范围。 FreeDoM 的优势在于其简单性、有效性和低成本。实验表明,FreeDoM 在各种条件下都有效,适用于不同数据域(包括图像和潜在代码域)的扩散模型。

更多Ai资讯:公主号AiCharm
在这里插入图片描述

计算机保研面试复习专业课篇(408)主要涵盖了计算机科学与技术专业本科生在保研面试中常常需要准备的四门核心专业课程,包括数据结构、计算机网络、操作系统和计算机组成原理。这四门课程是计算机专业教育的基础,无论是在保研还是考研面试中都占有十分重要的地位。了解这些课程的常问知识点,对于提升面试竞争力至关重要。数据结构是计算机存储、组织数据的方式,它使得数据的查找和更新更加高效。在面试中,关于数据结构的常见问题可能包括数组、链表、栈、队列、树、图等基本数据结构的定义、特点和应用场景。此外,还会涉及排序算法、搜索算法以及树和图的遍历、生成树算法等。面试者需要能够清晰地解释这些算法的工作原理,以及它们的效率如何。计算机网络部分,面试者需要掌握网络基础知识,如网络分层模型(OSI七层模型和TCP/IP四层模型)、IP地址、子网划分、TCP/IP协议族中的重要协议如IP、TCP、UDP等的工作原理及其应用。同时,网络安全、网络性能优化、以及一些常见的网络应用如DNS、HTTP/HTTPS、电子邮件和FTP的工作原理也是面试中可能出现的问题。操作系统部分,涉及的主要知识点包括进程管理、内存管理、文件系统以及I/O系统。面试者应该熟悉进程状态、进程调度算法、同步与互斥机制、死锁的产生条件及避免方法等。对于内存管理,重点内容可能包括分页、分段、虚拟内存等概念,以及它们如何优化内存使用。文件系统的层次结构、文件的存储方式、目录的组织方式也是面试中的常考点。计算机组成原理部分,面试者需要对计算机硬件组件有深入理解,包括中央处理器(CPU)、存储器、输入输出设备等。常见的面试问题会围绕CPU的控制单元、运算单元和内部寄存器的设计,存储层次结构包括高速缓存、主存和辅存的工作原理,以及指令周期、指令集架构等概念。计算机保研面试复习专业课篇(408)强调了专业知识的系统性和深度,要求面试者不仅能够熟练掌握理论知识,还要具备解决实际问题的能力。准备这些内容,对于希望在计算机领域深造的学生来说是十分必要的。通过对这些课程的复习,学生可以更好地展示自己在计算机科学方面的专业素养,为保研面试做好充分的准备。
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

AiCharm

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值