每日学术速递3.22

CV - 计算机视觉 | ML - 机器学习 | RL - 强化学习 | NLP 自然语言处理

Subjects: cs.CV

1.DS-Fusion: Artistic Typography via Discriminated and Stylized Diffusion

标题：DS-Fusion：通过辨别和程式化扩散的艺术排版

作者：Maham Tanveer, Yizhi Wang, Ali Mahdavi-Amiri, Hao Zhang

文章链接：https://arxiv.org/abs/2303.09604

项目代码：https://ds-fusion.github.io/

摘要：

我们介绍了一种新颖的方法，通过对一种或多种字母字体进行风格化来自动生成艺术排版，以直观地传达输入词的语义，同时确保输出保持可读性。为了解决我们手头任务的各种挑战，包括相互冲突的目标（艺术风格化与易读性）、缺乏基本事实和巨大的搜索空间，我们的方法利用大型语言模型来桥接文本和视觉图像以进行风格化，并建立一个无监督的具有扩散模型骨干的生成模型。具体来说，我们在潜在扩散模型 (LDM) 中使用去噪生成器，并关键添加了一个基于 CNN 的鉴别器，以将输入样式适应输入文本。鉴别器使用给定字母/单词字体的光栅化图像作为真实样本，并将去噪生成器的输出作为假样本。我们的模型被创造为 DS-Fusion，用于区分和程式化的扩散。我们通过大量示例、定性和定量评估以及消融研究展示了我们方法的质量和多功能性。用户研究与包括 CLIPDraw 和 DALL-E 2 在内的强基线以及艺术家制作的排版进行比较，证明了 DS-Fusion 的强大性能。

扫描二维码关注公众号，回复： 14647021 查看本文章

2.HIVE: Harnessing Human Feedback for Instructional Visual Editing

标题：HIVE：利用人类反馈进行教学视觉编辑

作者：Jiayu Jiao, Yu-Ming Tang, Kun-Yu Lin, Yipeng Gao, Jinhua Ma, YaoWei Wang, Wei-Shi Zheng

文章链接：https://arxiv.org/abs/2303.09618

摘要：

结合人类反馈已被证明对于使大型语言模型生成的文本与人类偏好保持一致至关重要。我们假设最先进的教学图像编辑模型，其中输出是根据输入图像和编辑指令生成的，同样可以从人类反馈中受益，因为它们的输出可能不符合用户的正确指令和偏好.在本文中，我们提出了一个新的框架来利用人类反馈进行教学可视化编辑 (HIVE)。具体来说，我们收集人类对编辑图像的反馈，并学习奖励函数来捕捉潜在的用户偏好。然后，我们介绍了可扩展的扩散模型微调方法，该方法可以根据估计的奖励结合人类偏好。此外，为了减轻数据限制带来的偏差，我们贡献了一个新的 1M 训练数据集、一个用于奖励学习的 3.6K 奖励数据集和一个 1K 评估数据集，以提高教学图像编辑的性能。我们在定量和定性方面进行了广泛的实证实验，表明 HIVE 在很大程度上优于以前最先进的教学图像编辑方法。

3.FreeDoM: Training-Free Energy-Guided Conditional Diffusion Model

标题：FreeDoM：无训练能量引导条件扩散模型

作者：Jiwen Yu, Yinhuai Wang, Chen Zhao, Bernard Ghanem, Jian Zhang

文章链接：https://arxiv.org/abs/2302.01660v2

项目代码：https://github.com/ysig/learnable-typewriter

摘要：

最近，条件扩散模型因其出色的生成能力而在众多应用中受到欢迎。然而，许多现有方法需要训练。他们需要训练一个依赖时间的分类器或一个依赖条件的分数估计器，这增加了构建条件扩散模型的成本，并且不方便在不同条件下迁移。目前的一些工作旨在通过提出免训练解决方案来克服这一限制，但大多数只能应用于特定类别的任务，而不适用于更一般的条件。在这项工作中，我们提出了一种用于各种条件的无训练条件扩散模型 (FreeDoM)。具体来说，我们利用现成的预训练网络（例如人脸检测模型）来构建与时间无关的能量函数，该函数无需训练即可指导生成过程。此外，由于能量函数的构建非常灵活并且适应各种条件，我们提出的 FreeDoM 比现有的免训练方法具有更广泛的应用范围。 FreeDoM 的优势在于其简单性、有效性和低成本。实验表明，FreeDoM 在各种条件下都有效，适用于不同数据域（包括图像和潜在代码域）的扩散模型。

更多Ai资讯：公主号AiCharm
在这里插入图片描述

Subjects: cs.CV

1.DS-Fusion: Artistic Typography via Discriminated and Stylized Diffusion

2.HIVE: Harnessing Human Feedback for Instructional Visual Editing

3.FreeDoM: Training-Free Energy-Guided Conditional Diffusion Model

猜你喜欢