SYSTEM NOTICE

Auto translation by AI. Be sure, accuracy, nuances and authorial intent may not be fully reflected.
見出し画像

Curso de IA de desenho compreendida como magia

Sobre a alquimia de imagens por IA, que se torna mais como um feitiço quanto mais você pratica.

Abaixo está um curso de lógica e controle rudimentar que pode deixar os especialistas da área muito irritados.

Basicamente, know-how que funciona de forma comum nos principais serviços (DALL-E2, MidJourney, StableDiffusion, DiscoDiffusion, crayon, dall-e mini, etc.).


Entendendo de forma rudimentar como funciona a IA de imagens

Para uma IA interativa, feitiçoprompt é apenas algo que define a direçãovetor da alquimia da imagem.

Por exemplo, abaixo está um exemplo de uma imagem criada com "I love apple". De alguma forma, algo vago acaba surgindo.

I Love Apple

Isso ocorre porque a direçãovetor "Apple" possui simultaneamente múltiplas possibilidades, como "maçã", "maçã verde", "Apple Computer (logotipo antigo do arco-íris)" e "Apple Computer (novo logotipo)".

Em outras palavras, "Apple" é uma direçãovetor muito ambígua para a IA.

Não se sabe se é uma foto ou uma ilustração. Além disso, um "coração" também acabou se fundindo. Encantamentos curtos como este, na maioria dos casos, tornam-se incontroláveis.

A IA, diante de comandos ambíguos, acaba criando imagens que tentam satisfazer todas as possibilidades simultaneamente (nota: o fato de o rosto se dividir é um fenômeno diferente).

Para um excelente uso da IA, é necessário um design que agrupe a direçãovetor através do encantamento.

Abaixo está um encantamento com a restrição de "maçã, a fruta". Melhorou, mas ainda existem uma maçã vermelha e uma maçã verde ao mesmo tempo.

I love Apple (fruit)

Dessa forma, mesmo para produzir uma única maçã, é necessário um encantamento de direçãovetor adequado.

Na verdade, para um encantamento mais estável, é preciso mudar a forma de pensar.

Se você disser "uma única maçã vermelha, de boa qualidade fotográfica, em um fundo simples, para um site de e-commerce"

então a maçã será criada de uma só vez.

good quality photography of a singular red apple on simple background for e-commerce site --stop 75

As "fotos de produtos para e-commerce" possuem alta reprodutibilidade de fundo e layout. Ao perceber isso, você pode refinar bons feitiçosprompts.

No entanto, os vetores da IA chegam a milhares de dimensões. Mesmo que você alinhe palavras aleatoriamente, várias palavras acabarão cancelando os vetores umas das outras.

Portanto, para utilizar bem a IA, são necessários dois entendimentos: "vocabulário de palavras poderosasrunas que direcionam fortemente o vetor" e "montagem de feitiços com reprodutibilidade".

Dica rápida
Quando as cores estão em um "estado que parece uma mistura de vermelho, azul e verde", considera-se que o vetor está vago demais. Esse não é o estilo artístico do MidJourney. É um estado que precisa de mais delimitação vetorial.


Busque palavras poderosas

Palavras poderosasrunas são palavras com uma direção claravetor forte. Pode-se dizer que são "palavras puras sem ambiguidade".

Isso se deve ao mecanismo de aprendizado da IA. A IA aprende emparelhando imagens e seus textos explicativos encontrados na internet. A partir do aprendizado de inúmeros pares, ela forma um espaço vetorial que poderia ser chamado de espaço de possibilidadesregistro akáshico.

Devido a esse mecanismo, uma força poderosa nasce nos "pares de imagem e texto que aparecem repetidamente sem que o conteúdo se desvie durante o aprendizado".

Ao colocar runas como "Unreal Engine" ou "Playstation5" na seção final do encantamento, a qualidade da imagem tende a melhorar. Isso ocorre provavelmente porque a IA aprendeu, a partir de pares de artigos e imagens, conteúdos como "Unreal Engine (nome de ferramenta de criação de jogos) tem uma qualidade de imagem incrível".

Da mesma forma, adicionar "beautiful concept art of" na primeira seção também é forte. Isso também ocorre porque "imagens chamadas de arte conceitual média são bem desenhadas".

Abaixo, apresento um gráfico comparativo.

landscape
landscape by unrealengine
beautiful concept art of landscape

Runas fortes que recomendo pessoalmente são as configurações de câmera.

Se você adicionar ao final do encantamento algo como "fotografado com Canon EOS 5D Mark 4 e lente SIGMA Art Lens 35mm F1.4 DG HSM, abertura F2.4, ISO 200, velocidade do obturador 2000", a qualidade aumentará significativamente.

Você pode controlar não apenas a qualidade da imagem, mas também a composição, iluminação, desfoque e muito mais.

landscape taken by Caanon EOS 5D Mark4 and SIGMA Art Lens 35mm F1.4 DG HSM, F1.4, ISO 200 Shutter Speed 2000

Isso ocorre porque a IA aprendeu que "imagens com tais descrições são fotos profissionais, fotos de amostra oficiais de fabricantes ou obras de sites de fotos tiradas por amadores avançados". Quando você quer obter desfoque frontal ou traseiro, funciona como uma runa forte.

Se estiver em dúvida, use a câmera!

Primeiramente, os iniciantes devem encontrar seu repertório de runas poderosas enquanto se divertem.


Busque por sintaxes poderosas

A ordem da seleção das palavras durante o encantamento também é importante.

Abaixo, a diferença de exibição entre "paisagem com robô" e "robô com paisagem".

robô com paisagem
paisagem com robô

À primeira vista, mesmo em comandos que parecem iguais, percebe-se que o tratamento do robô muda drasticamente. Desta forma, "o que dizer e em que ordem? influencia significativamente a qualidade da alquimia de imagens.

Como princípio, possui vagamente características como: "as frases no início são mais fortes, enquanto as palavras no final são mais fracas", "a última frase é moderadamente forte" e "as palavras antes de preposições ou pronomes relativos tendem a ser mais fortes, enquanto as palavras depois são mais fracas".

Basicamente, é melhor criar o feitiçoprompt| com um estilo de escrita próximo ao de legendas de museus, sites de fotografia ou livros de arte.

Entre os magos avançados que praticam a alquimia por IA desde os primórdios, parece que a seguinte estrutura tornou-se um padrão.

<Formato geral><Assunto><Complemento do assunto><Autor><Complemento geral><Sabor>

Ritmo de encantamento recomendado

<Formato geral>Pintura a óleo detalhada de
<Assunto>O grande castelo branco em uma paisagem de floresta profunda
<Espírito heroico>por CASPAR DAVID FRIEDRICH e CLAUDE LORRAIN,
<Complemento geral> iluminação perfeita, hora dourada,
<Sabor> tirada com Canon 5D Mk4

Pintura a óleo detalhada de O grande castelo branco em uma paisagem de floresta profunda por CASPAR DAVID FRIEDRICH e CLAUDE LORRAIN, iluminação perfeita, hora dourada, tirada com Canon 5D Mk4 --ar 16:9



Invoque os antigos e grandiosos

No encantamento da magia de IA, inserir o nome de um antigo e grandioso na segunda ou terceira sílaba estabiliza a precisão. É o nome de um espírito heroico de topo como Da Vinci ou Rembrandt, ou o nome de alguém antigo que ainda não foi esquecido, como Caravaggio.

Basicamente, ao desenhar paisagens, a precisão aumenta se você tecer o nome de um pintor de paisagens no encantamento, e ao desenhar retratos, o nome de um pintor de retratos.

Ao entoar o nome de um mestre da pintura de figuras, a geração de rostos e a iluminação tornam-se mais estáveis.

No entanto, é melhor pensar que o que é invocado aqui não é o próprio Da Vinci, mas sim "algo que personifica o que é da Vinci".

O que a IA aprendeu foi apenas um "conjunto de imagens vinculadas à palavra Da Vinci". Isso ocorre porque também estão misturados elementos dos discípulos de Da Vinci, obras influenciadas por ele, a casa de sua família e obras comparadas a ele.

Ao entoar "retrato feito por Dalí", o próprio Dalí aparece!

portrait by Salvador Dalí

Isso acontece porque o espaço vetorial de "Salvador Dalí" contém muitas fotos de performances entusiasmadas e autorretratos do próprio Dalí. Assim, não estamos conversando com a IA de forma limitada. É importante ter a consciência de que estamos passando parâmetros vetoriais para a IA indiretamente através da linguagem.

Aliás, heróis e espíritos sofrem correções baseadas em região e popularidade. Mesmo que você entoe o nome de um herói japonês, é difícil controlá-lo sob a base mágica ocidental (IA americana).Em termos de correção de popularidade, a menos que seja um grande herói do nível de Hokusai, é difícil obter estabilidade.

Mesmo com o mesmo comando "landscape painting of forests", apenas mudar o autor altera o resultado drasticamente.

landscape painring of forests by J. M. W. Turner --ar 16:9
landscape painring of forests by Hieronymus Bosch --ar 16:9

Pessoalmente, recomendo consagrar vários heróis juntos. Os chamados heróis compostos. Se você misturar heróis com atributos semelhantes, a expressão se estabiliza. Por outro lado, se você misturar heróis com atributos diferentes, a expressão se torna instável, mas é mesclada.

A imagem abaixo é uma combinação da pintura de Bosch, usada como exemplo na imagem acima, com outro autor. Pode-se ver que, mantendo a sensação de objetos densos característica de Bosch, o estilo artístico tornou-se completamente diferente.

O vetor de Bosch combinado com o vetor de outro autor


Acho que é melhor evitar o uso isolado de nomes de artistas contemporâneos, tanto quanto possível. Basicamente, ao inserir nomes de pintores, acho melhor incluir vários ou usar principalmente nomes de pessoas que faleceram há mais de 70 anos, para não criar prompts que dependam demais do estilo de um indivíduo específico.

Mais do que legal, você pode acabar se envolvendo em problemas emocionais ou de ética. (A lei de direitos autorais, em princípio, é concedida às obras individuais em si, e estilos, ideias e conceitos não são, por si sós, objeto de proteção da lei de direitos autorais).

Para quem prioriza evitar riscos, é melhor invocar épocas ou movimentos inteiros, como "Renascimento" ou "Rococó".

Sinto que isso provavelmente se tornará uma questão de etiqueta em um futuro próximo.


Nunca insira nomes de atores, políticos ou celebridades reais!

Existe um know-how de estabilização de imagens humanas que consiste em "inserir o nome de uma celebridade real".Mas, definitivamente, definitivamente, é melhor não fazer isso.

É melhor considerar isso como um feitiço proibido.

Já presenciei um caso terrível de morte súbita na linha do tempo do Discord.

Alguém estava tentando criar uma imagem combinando frases como "atriz de Hollywood" e "foto de uma princesa cavaleira capturada". Provavelmente, a própria pessoa não tinha más intenções e queria apenas aumentar a qualidade da obra de "algo como uma princesa cavaleira capturada". Acho que foi por isso que ela inseriu casualmente o nome de uma "atriz de Hollywood".

No entanto, a IA gerou de repente "algo como uma princesa cavaleira fotorrealista com os seios à mostra, e com o rosto de uma atriz de Hollywood"!!

Deve ter sido um acidente, mas é uma imagem bastante perigosa.

A imagem foi apagada por quem a criou descuidadamente ou foi removida pela administração após receber denúncias, e o problema foi resolvido. Provavelmente foi um acidente infeliz, sem intenção maliciosa.

Mas, se essa imagem tivesse vindo a público... ela se tornaria um autêntico pornô falso. Se tivesse se espalhado, seria um desastre com indenizações inevitáveis.

A alquimia humana usando celebridades como base tem esse risco de morte súbita. Com o comportamento atual da IA, imagens impróprias de pessoas reais podem ser criadas repentinamente, mesmo sem a sua intenção.Acho melhor não criar levianamente prompts que contenham nomes de celebridades.

A polícia vai bater na sua porta

De qualquer forma, é melhor nunca criar "prompts com nomes reais que possam formar o rosto de uma pessoa real". Como esse tipo de acidente e incidente deve ocorrer com frequência daqui para frente, faço este forte alerta com antecedência.


Vamos entender a raiz da IA

Abaixo, um pouco mais de conversa técnica aprofundada.

Esses métodos de geração de imagem, como MidJourney, DALL-E e Stable Diffusion, baseiam-se em uma tecnologia chamada Clip Guided. Se você entender esse mecanismo, será mais fácil visualizar os vetores de texto.

O Clip é uma IA que converte imagens e textos em "vetores comparáveis entre si". De forma mais simples, pode-se dizer que é uma IA que mede com uma pontuação: "Qual é o grau de correspondência entre este par de imagem e texto?"

A geração de imagem atual usa esse Clip para gerar imagens de modo que a distância entre o "texto" e a "imagem" seja a menor possível.

A IA é criada treinando centenas de milhões de "pares de imagens e textos". Ou seja, ela é treinada com "imagens da internet e as legendas anexadas a elas".

Por isso, a geração de imagem do tipo Clip tenta gerar uma "imagem que receba uma legenda do usuário e que pareça formar um par com essa legenda". Se você entender essa regra básica, a precisão da alquimia de imagens aumentará significativamente.

Para obter a imagem desejada, basta imaginar: "Que tipo de legenda teria a imagem que eu quero se ela estivesse em um site de museu, site de e-commerce ou site de fotos?" e pensar em um texto que combine com isso.

A "sintaxe básica" mencionada anteriormente é feita com uma estrutura muito próxima a essa.

<Formato geral><Tema><Complemento do tema><Autor><Complemento geral><Sabor>

Pintura a óleo "Paisagem com girassóis" (de Van Gogh). Sol vermelho intenso e tons apaixonados, pinceladas fortes… escrever dessa forma é muito próximo das descrições em museus ou catálogos de leilões de arte.

À medida que você se acostuma, existem métodos de notação ainda mais especiais (injeção direta de pesos vetoriais), mas isso é magia avançada, então é um assunto para outra hora.

Exemplo de notação de injeção direta de vetores
oil painting::1 landscape with sunflower::1 by Vincent van Gogh::0.25 water color ::-0.25


Existem vários outros truques, como indução usando ruído ou desenhos originais, inpainting (correção e preenchimento), ampliação, redução, IA composta, conversão para materiais de Photoshop ou Blender... mas... ficaria muito longo, então vou pular.

Bem, pessoal, sigam as instruções de uso e tenham uma vida mágica divertida!

High quality concept art of a mage standing at the center of a magic circle and exercising great magic. Center of the legendary chapel, many crowds. High fantasy. Golden. XXXXXXXX composition. XXXXX light. The glow of magic. XXXXXXXX XXXXXXXX. art station trending, octane render, 8k, by XXXXXXXX and XXXXXXXX and XXXXXXXX, golden, crazy detailing


Bônus, o mistério deve ser mantido em segredo...?

Ocultismo é escrito como ciência oculta, masmagia pode ser considerada um sistema técnico de "ocultar o processo e revelar apenas o resultado".Ou seja, na visão da magia, esse tipo de know-how só ganha valor e poder se for guardado apenas para si. É o famoso "

o mistério deve ser mantido em segredo".

No entanto, estamos no século XXI. Na era da internet, a disseminação de informações tornou-se irreversível e rápida. Mistérios ocultos serão espalhados gratuitamente por alguém na rede em poucos dias. Já não é realista monopolizar informações.

Sendo assim, penso que deveríamos publicar informações periodicamente e, ao reunir o conhecimento, chegar à raiz profunda da magia...

Quanto aos prompts, há uma cola no DALL-E Prompt Book abaixo. Se você ler isso, acho que entenderá rapidamente as palavras básicas necessárias.


Além disso, memorizar as peculiaridades de cada IA ou feitiçosprompts não faz muito sentido. Basta olhar a cola.

O know-how que você realmente deve aprender é "Como formular hipóteses sobre o comportamento em pouco tempo e colocá-lo sob controle provisório ao encontrar uma nova tecnologia de caixa preta?" Acredito que a reprodutibilidade dessa técnica é o que importa.




Esboços de mechas, por exemplo



Pessoas que querem entender tecnicamente ou experimentar o código

Quem estudou bem os mecanismos, leia o seguinte.


Para quem quer ler o código fundamental, pesquise sobre Latente Diffusion Model ou Glide X3.



Enquanto eu revisava este artigo por uns 3 dias e tentava manter a consistência com o mundo de typemoon, @shi3z publicou um artigo antes de mim. Estou muito frustrado.


いいなと思ったら応援しよう!

深津 貴之 (fladdict) いただいたサポートは、コロナでオフィスいけてないので、コロナあけにnoteチームにピザおごったり、サービス設計の参考書籍代にします。

この記事が参加している募集