見出し画像

新モデル「Tsubaki」を使って無理難題。|PIXAI|次世代モデル|

2025年7月10日に「Tsubaki つばき」が正式リリースされました。αTEST ,βTESTと使わせていただきました。その使用感レポートになります。
まず「Tsubaki」は PIXAIの独自開発によるStable Diffusion系(以下SD系)の最新モデルでサイト内のみの公開になります。WEBサービス事業者は差別化のため自身のサイトのみ公開のモデルを制作しています。(億単位の開発費ですからね)また、Tsubakiはリアル系モデルではないのでご理解ください。
同時に、プロンプトヘルパー(プロンプト自動変換)も最新のものに更新され、こちらの性能も良質で、Tsubakiとの相性も良いです。
「Tsubaki」は、SD系ではありますが以下の点が次元を超えて性能発揮しています。SD系はだいたい3ヶ月に一度くらいのペースで大きく発展します。
半年前は昔の話になります。(Illustrious2.0, Animagin1.0あたりが前回の山でしょうか。)
長くなりましたTsubaki、結論から言うと最高。
色々とモデルを見てきましたが、いつも「新しくなったね〜」「〇〇が綺麗に描けるようになった!」とかでしたが今回のTsubakiはαTESTの時点でXL全てを古くするぐらいの衝撃を受けました。(大きな変化です。)
・自然言語理解力:これはGPTでも使われている技術の成果。言語理解力が異常に上がりました(プロンプト自動変換)の相乗効果もあり。また各国の言語で入力可能で自然文で大丈夫です。(※1事例有)DALL・E3に近く、一部超えている理解力です。SD系も追いついたと言い換えられますね。
・プロンプト理解力:上記と似ていますが、それを具体的な絵にする力。
画面構成、対象物の位置関係、人物であれば仕草、表情、素晴らしい👍。
・複数対象物の関係理解:これも位置関係と関連していますが、関係というぐらいです対象は複数になります。そして生成AIでは複数の書き分けが難しいのですが(全てのAI生成)キャラクターなら4〜5人描き分けられます。そしてそのキャラの位置も指定できます。(※2事例有)

私の評価基準は以下の通り:なかなか数値化できないものがあるので
以下の能力で判断しています。実際の使用感と強く結びつきます。

(高級言語)+(言語再現・画面構成力)+(画質)+(既知識)+LoRA

これぐらいできないと、AIじゃない的な上から目線です(笑)
LoRAはこの記事を書いている時点では未実装ですが、間も無く公開されるとのこと、新しいアーキテクトなので過去のLoRAは使えません。
LoRA作成もPIXAI内でできるので楽しみです。


以下 事業者の自慢に基づいた私の使用感。事業者の自慢点を私が評価。
キャラクター整合エンジン=未確認。
物語理解力=確認済み。(評価:⭐️⭐️⭐️)やばい!(※3事例有)
構図表現の革新=確認済み。(評価:⭐️⭐️⭐️)ユーザー側のコントロール技術を上げなければ。composition系の指示は機能します。確認済み。)
光と影の高度な演出
=(評価:⭐️⭐️⭐️)ユーザー側のコントロール技術を上げなければ、、、。黙っていてもいいのが出てくるのですが、ユーザーが指示できるかどうかは未確認。(私のスキルの問題。)

※私は既存のコンテンツ(版権もの)の呼び出しはほぼしませんので、どこまでできるかは試行回数が少ないため未確認としますがPIXAIですからできちゃうでしょう。
また事業者の詳しい解説もありますのでこちらをお読みくださいませ。

さて、本題です。「Tsubaki」を使ってみた。

🔸事例1 ⚠️画像は全てαもしくはβで 現行版ではないです。
この頃は画質が良くなかったので、Tsubakiで描いたものを参考画像にして
他のモデルで清書していました。ここに貼っているものは全て清書前のTsubakiです。短い日本語でどこまでかける?(流石に現代語訳しました。)
キャプションがそのままプロンプトです。

  古池に蛙が飛び込む水の音              咳をしても一人
shopping, lots of spresent box, holding present box, stacked present box, girl walk in GINZA, beautiful details, fine illustration, , head up, looking at viewer, white hair, necklace, 1 girl, cute, bob cut, thick lips, (((from side, full body,white background ))),
※箱を積み上げて持って歩くのはプロンプトでも難しい。簡単にやってのけました。
長い黒髪の女性が着物姿で三味線をひいいています、隣にいる女性は金髪のショートボブでストリートパックな服装で、エアーギターを弾いています(ギターをもたずに、弾いているだけのポーズ)※残念ながら、エアーギターは理解できないようだ。

🔸事例2 ⚠️画像は全てαもしくはβで 現行版ではないです。
順番を指定して描いています。念の為に、逆の順番も書き加えています。

ファンタジーな夢の世界を描きます。 フレーメンの音楽隊(童話)のように動物たちが重なっています。 上から雄鶏、黒猫、犬、アルパカの順に背中の上に載っています。 (下から、アルパカ、犬、黒猫、雄鶏の順番) ただこれは、楽しんでいるだけです。まな楽しそうにしています。空には小鳥たち、 足元には針ネズミの夫婦ががその様子を見て笑っています。 田舎の田園風景、丘の上、晴れた春の日。

いや、それにしても誤字脱字多いですねプロンプト。でも、この状態で描いています。

🔸事例3
2girls, multiple girls, animal ear.
緑の冒険服を着た猫耳少女と赤い髪の猫耳少女のツーショット
赤い猫耳少女(笑顔、赤い冒険服)が、緑の猫耳冒険者の方に手を回す、馴れ馴れしい。
緑の猫耳少女は、ちょっと、戸惑い顔
■ ギルド登録
中は活気に満ちていた。
■ 偶然の出会い(カグラ)
そのとき。

「あー、それってさ、食べ放題のやつだよね?」

横からぐいっと顔を突っ込んできたのは、赤い髪の、元気そうな少女だった。
獣人の耳と大きな牙を見せて笑う。

「アタシも行っていい? ちょうど腹減ってたとこなんだよね~!」

ミナは思わずたじろいだ。

「え、あの、えっと……?」

受付嬢があっさり頷く。

「彼女はカグラさん、有名な戦闘部族“アグナ流”の出身よ。腕は確かよ。」

「へへっ。ネズミくらいなら朝メシ前ってやつ!」

そう言って、カグラはミナの肩をバン、と叩いた。

「よろしくな、ミナ!」

突然小説がを書ききましたが、この小説がそのままプロンプトです。
キャラクターがちゃんと描き分けられているかわかるように、
小説のキャラクターに色をつけました。
ちなみに4000文字ぐらいいけます。ただ、描くのは1枚なので、長すぎてもね。
シーンの部分を切り取ってあげましょう。

と、長くなりましたのでここまでで。いや、今読み返しても、プロンプトに誤字多いな。それでも描いてくれるのはありがたい。また、他の方もそうだと思いますが、貼り付けられているものは一番いい、もしくはわかりやすいものです。
AI生成やられている方ならお分かりになると思いますが、指示していないところはAIが勝手に考えて描くので、いいものもあれば、気に入らないものもあります。イメージがしっかりとあるのであればしっかりプロンプトにしましょう。

早くLoRAできないかな。そうすれば、オリキャラで構成できるのに。(多分)


いいなと思ったら応援しよう!

picko よろしければ応援お願いします! いただいたチップは 『誰かにチップを配ります』パカ