AIGC多模态

一、介绍
1.什么是AIGC

AIGC(Artificial Intelligence Generated Content),人工智能生成内容。

是一种利用人工智能技术自动生成内容的技术。AIGC技术通过接收用户的任务指令,处理自然语言,自动生成图片、视频、音频等内容

内容孪生(包括智能增强/转译):图像超分/语音转字幕

内容编辑(理解内容/属性控制):场景剪辑/虚拟试衣/人声分离

内容生成:图像/文本/视频/多模态生成

2.AIGC应用场景

影视行业(画质增强/虚拟场景)

电商行业(3D模型/虚拟主播带货/虚拟商城)

娱乐行业(图像融合/风格转换/聊天机器人🤖/互动游戏🎮)

教育行业(教学素材/机构模型/数字化)

3.AIGC产品生态

基础层(模型服务)(预训练模型):基础设施,api接口,专业软件

中间层(垂直/场景/个性化):二次开发/应用模型/工具

应用层(各种AIGC应用):用户需求/产品落地(网页/小程序/APP)

二、图像生成

变分自编码器(VAE):

Variational Autoencoder,以概率的方式对图像的潜在空间进行观察👀描述,数据生成

生成对抗网络(GAN):

Generative Adversarial Networks,零和博弈,使用广泛,生成器和判别器

扩散模型Diffusion:

最流行,扩散步骤,添加噪声,扩散噪声的逆过程

2.VAE

处理过程

通过编码器Encoder Network(卷积conv实现)特征提取,通过高斯分布来描述潜在空间的特征,均值和方差,编码完成之后去生成图片,从潜在空间对每个特征进行采样,再经过解码器Decoder latent vector(反卷积deconv)变成图片
在这里插入图片描述
VAE的特征

VAE是深度生成模型,整个网络是一个卷积网络,描述潜在空间的概率特征,有高应用价值,图像经过解码器会有多种特征,每次采样的结果不同 ,生成的图像也不同

3.GAN

构成

GAN网络 由生成器和判别器构成,生成器负责生成图片,判别器辅助我们判断生成器生成的图片是否逼真,生成器通过学习合理的数据,判别器去判别输入的数据是生成数据还是真实数据,当网络输出越接近于0时,生成数据可能性越大,当网络输出越接近于1时,说明是真实数据的可能性越大,也就是说明生成的图片越接近于我们的真实数据

处理过程
Generator生成器的输入是随机噪声(random noise),Discriminator判别器进行二分类,判断这个图片输入进来的是真实的图片还是生成器生成的图片,直到判别器把生成的图片也判断成真实的图片,那就可以说明生成器生成的图片效果是比较好的,就可以用生成器来生成图片
在这里插入图片描述

4.扩散模型

思想

扩散模型包括前向过程和反向过程,受非平衡热力学的启发,用于去噪,前向扩散过程:图像会被引入的噪声污染,将图像逐步引入噪声,直到成为完全随机噪声,这一过程将噪声逐步扩散到图像的每个像素,最终使得图像无法辨识;反向降噪过程:通过从高斯噪声中逐步去除噪声,还原出源数据的清晰信号,提高信号的保真度和可靠性,反向过程恢复的是原始图像的变种图像,它和原图不是一模一样的

处理过程
在这里插入图片描述
应用

图像超分/上色/文本生成图片/全景图像生成

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值