見出し画像

ComfyUIでKolorsを試す(中英(+日)に対応、VRAM 8GB)

※ Last update 12-30-2024
※ 日本語プロンプトは「一応使える」程度のものなので、英語または中国語を推奨します。中国語の方がより得意に見えます。




■ 0. 概要

▼ 0-0. はじめに

 本記事ではComfyUIで画像生成AIの「Kolors」を利用してみます。Kolorsはショートビデオ配信サービスを行っている中国のKuaishou Technology(快手)が開発し、2024年の夏頃にリリースされました。

 KolorsはText EncoderにChatGLM3を利用していて、ChatGLM3は英語と中国語に対応しています。ところが、実際には日本語も通用するようです。VAEはSDXLと共通です。

 下記ポストに掲載した画像のプロンプトは「田舎の丘の上で、ピンクのワンピースを着た女の子が犬と歩いています。周囲に花が咲き、遠くに青い海が見えます。」です。裸足が気になりますが、周囲にだけ花が咲くなど、プロンプトの理解度が見て取れます。

 その他の情報は下記のリンク先を参照してください。

▼ 0-1. 関連リンク



■ 1. 利用の準備

▼ 1-1. 概要

 先ほどリンクを示したComfyUI-Kolors-MZを利用します。導入の手順が書いてあり、IPAdapterやControlNetの情報もあります。詳細はリンク先を確認してください。本記事では単純に生成するところまでです。

 なお、モデルの種類が混乱しないよう、デフォルトの場所にディレクトリを作成して、その下に設置する方針をとっています。

▼ 1-2. カスタムノードのインストール

 コマンドプロンプトを開いてから「ComfyUI\custom_nodes」へ移動して、下記のコマンドを実行します(Gitが必要)。もちろん、ComfyUI-Managerを用いてComfyUI上からインストールしても構いません。

git clone https://github.com/MinusZoneAI/ComfyUI-Kolors-MZ

▼ 1-3. モデル等の設置

 モデルは公式のオリジナルと、Civitaiで見つけたアニメモデルを利用します。お好みで、いずれかまたは両方をダウンロードしてください。

 Text EncoderのChatGLM3は8bitを選び、リソース不足が気になる場合は4bitと比べてみるのが良いでしょう

 VAEはSDXLと共通です。未設置であればダウンロードしてください。



■ 2. ワークフローを用いて生成

▼ 2-1. 概要

 出力の品質を考慮して、本記事のワークフローはt2iを行った後でアップスケールとi2iを行っています。Tiled VAE利用の有無で2種類を用意しました 。いずれも簡素なオリジナルなので、自由に改造、再公開していただいて構いません。

▼ 2-2. 補足

 もう一度書いておくと、Kolorsのプロンプトは英語と中国語に対応していますが、日本語も通じるようです。言語によってプロンプトの効き方が変わるようです(体感で「中>英>>日」)。

▼ 2-3. ワークフロー(Tiled無し)

 単純にt2i、アップスケール、i2iの順番で処理を行います。リソースが十分にある場合はこちらを選び、VRAMが不足する場合などはTiled有りの方を試してみてください。

 ワークフローをダウンロードして、ComfyUIの画面にドラッグ&ドロップしてください。一段目の画像も保存したい場合は、右上のノードを選択してCtrl+Mを押すとミュートが解除されます。

ワークフローを実行したところ
プロンプトは「アニメスタイルの水彩画。ロングヘアーの女の子が、白いドレスとサンダルの姿で微笑んでいます。女の子の隣には黒い猫がいます。周囲に花が咲く自然の断崖で、そのむこうに海と島が見えます。」

 stepsの値は低めで、1回目は15、2回目は12に設定しています。通常は25~30程度のようです。cfgも低めにしています。出力したいスタイルや要求する品質に応じて、調整してみてください。

▼ 2-4. ワークフロー(Tiled有り)

 基本的には2-3.と同じです。アップスケール後のVAE EncodeとDecodeにTiled(処理を分割して行う、ComfyUI標準のノードで現在はbeta版)を利用し、高解像度での生成に対応できます。ただし、生成にかかる時間も増えます。アップスケールの倍率を1.5から2.5に引き上げているので、お好みで変更してください。

 使い方は同様です。解像度が高めなので、筆者の環境では45秒(モデルの読み込みを含めると60秒)かかります。

ワークフローを実行したところ
プロンプトは「色彩柔和的,日本少女漫画中的一帧画面。短发大眼睛小女孩孩穿着淡紫色睡衣,在窗边看书。她身旁有一只白兔,窗外可以看到夜空、圆月和城市的灯光。」



■ 3. おまけ1

▼ 3-1. 概要

 2-3.のワークフローを用いて、プロンプトの言語を英、日、中それぞれで試してみます。翻訳の仕方によっても出力内容が変わると思いますので、あくまで参考としてください。プロンプトの作成にChatGPTを利用しています。

▼ 3-2. アニメ調(遊園地と魔法少女)

 まずは英語です。

プロンプトは「Japanese flat shade anime style. A cute, infant magical girl with long dark brown hair, wearing a pink and white frilly costume with ribbons and bows. Her cheeks are rosy, her eyes shyly downcast, and she leans in with an innocent, playful smile. Holding a heart-shaped gem wand, she stands in a lively amusement park at sunset, with colorful rides and blurred crowds bathed in a warm golden glow. Soft, watercolor-style with a dreamy, nostalgic vibe.」

 次は日本語です。プロンプトがうまく解釈できていないようです。工夫次第で改善する可能性はあります(未検証)。

プロンプトは「日本のフラットシェードアニメスタイル。長いダークブラウンの髪を持つかわいい幼い魔法少女。ピンクと白のフリルのコスチュームを着て、リボンとリボンで飾られている。頬は赤らみ、目を恥ずかしそうに伏せて、無邪気で遊び心のある笑顔を浮かべている。ハート型の宝石の杖を持ちながら、夕焼けに包まれた賑やかな遊園地に立っている。カラフルな乗り物やぼんやりした人混みが温かな金色の光に包まれている。柔らかい水彩風で、夢のようなノスタルジックな雰囲気。」

 最後に中国語(簡体)です。Kolorsの設計上、プロンプトは中国語が最も適しているかもしれません。

プロンプトは「日本平面色块动画风格。一位可爱的幼年魔法少女,长着深棕色的长发,穿着粉色和白色的荷叶边服装,上面点缀着缎带和蝴蝶结。她的脸颊微微泛红,眼神羞涩地低垂,露出天真又俏皮的微笑,身体微微向前倾。她手握一根心形宝石魔杖,站在夕阳映照下的热闹游乐园里,周围是五彩缤纷的游乐设施和沐浴在金色暖光中的模糊人群。整体呈现柔和的水彩画风,充满梦幻和怀旧的氛围。」

▼ 3-3. 実写風(ショッピングモールと少女)

 まずは英語です。

プロンプトは「A close-up of a young girl in a shopping mall, with a glass dome ceiling in the background. She has medium brown hair in twin braids, gray eyes, and a gentle smile. She holds out one hand while lifting one leg and grasping the hem of her sky-blue gothic dress with frilled hems and a large chest ribbon. Her outfit includes a headband, white frilled socks, and black Mary Jane shoes.」

 次は日本語です。評価はお任せします。なお、なぜかアニメ調で出力される場合があります。

プロンプトは「ショッピングモールの中で、ガラスドームの天井を背景にした女の子のクローズアップ。彼女は中くらいの茶色い髪をツインブレイドにしており、灰色の目と優しい笑顔を見せています。片手を差し出し、片足を少し上げて、スカイブルーのゴシックドレスの裾をつかんでいます。ドレスにはフリルの裾と大きな胸元のリボンがあり、ヘアバンド、白いフリルソックス、黒いメリージェーンシューズを履いています。」

 最後に中国語(簡体)です。体感で、英語よりも中国語の方がプロンプトの忠実度が高いように見えます。

プロンプトは「在购物中心内,背景是玻璃穹顶,特写镜头展示一个小女孩。她有中等棕色的双马尾,灰色眼睛,带着温柔的微笑。她伸出一只手,抬起一条腿,抓住天蓝色哥特风格裙子的裙边,裙子有褶边和大胸部丝带。她佩戴头带,穿着白色褶边袜子和黑色玛丽珍鞋。」

 窮屈そうにポーズを取っていたので、縦横のサイズを入れ替えてみました。

プロンプトは一つ前と同じ



■ 4. おまけ2

▼ 4-1. 概要

 1-3.にて紹介のみ行ったモデルを利用して、今までのプロンプトで生成を行ってみました。やはり、中国語プロンプトが最も適しているようにみえます。興味があれば、1枚目のプロンプトを中国語に翻訳したプロンプトで生成してみてください。

▼ 4-2. おまけ画像

プロンプトは「アニメスタイルの水彩画。ロングヘアーの女の子が、白いドレスとサンダルの姿で微笑んでいます。女の子の隣には黒い猫がいます。周囲に花が咲く自然の断崖で、そのむこうに海と島が見えます。」
プロンプトは「色彩柔和的,日本少女漫画中的一帧画面。短发大眼睛小女孩孩穿着淡紫色睡衣,在窗边看书。她身旁有一只白兔,窗外可以看到夜空、圆月和城市的灯光。」
プロンプトは「日本平面色块动画风格。一位可爱的幼年魔法少女,长着深棕色的长发,穿着粉色和白色的荷叶边服装,上面点缀着缎带和蝴蝶结。她的脸颊微微泛红,眼神羞涩地低垂,露出天真又俏皮的微笑,身体微微向前倾。她手握一根心形宝石魔杖,站在夕阳映照下的热闹游乐园里,周围是五彩缤纷的游乐设施和沐浴在金色暖光中的模糊人群。整体呈现柔和的水彩画风,充满梦幻和怀旧的氛围。」

 横長で生成される構図に難があるので、正方形にしています。

プロンプトは「在购物中心内,背景是玻璃穹顶,特写镜头展示一个小女孩。她有中等棕色的双马尾,灰色眼睛,带着温柔的微笑。她伸出一只手,抬起一条腿,抓住天蓝色哥特风格裙子的裙边,裙子有褶边和大胸部丝带。她佩戴头带,穿着白色褶边袜子和黑色玛丽珍鞋。」



■ 5. その他

 私が書いた他の記事は、メニューよりたどってください。

 記事に関することで何かありましたら、Xの@riddi0908までお願いします。


いいなと思ったら応援しよう!