ComfyUIでNewBie image Exp0.1を試す&プロンプト生成
Last update 7-28-2026
※ こちらは2025年12月に公開されたモデルです。
※ 関連記事は、ComfyUI の記事一覧にまとめてあります。
※ noteの質問箱 へ気軽に声をお寄せください。質問以外のメッセージの方が嬉しいかもしれません。回答は気まぐれなのでご了承ください。
■ 0. 概要
▼ 0-0. はじめに
本記事では、ComfyUIで「NewBie image Exp0.1」 を ComfyUI で利用する手順を説明します。また、このアーキテクチャ特有の XML 構造化プロンプトをAIチャットサービス上で作る方法(無料可)を暫定的に考案してみたので、4. にて紹介しています。
実はモデルが公開された2025年12月にも記事を書いていますが、専用の ComfyUI 環境が必要でした。同月に ComfyUI がネイティブ対応していたので、遅ればせながら本記事でフォローします。
ComfyUIのインストール方法は、下記の記事をご覧ください。
▼ 0-1. NewBie image Exp0.1について
改めて、特徴とモデルの情報を挙げておきます。こちらは ChatGPT が出力した内容を参考にしています。
アニメスタイルに特化
SDXLのU-Netとは異なる、Next-DiTベースのアーキテクチャ
モデルは小型で、パラメーター数は SDXL と同等の 3.5B
Text Encoder は小型の Gemma3-4B-it と Jina CLIP v2 を採用
VAE は FLUX.1 のものを採用
プロンプトは、複数キャラクターを個別に設定しやすい XML構造化(利用方法は 3.~4. を参照)のほか、自然文やDanbooruタグにも対応
基本は 1MP(1024x1024 等)の出力に対応。参考まで、ComfyUI 公式のテンプレートは 1024x1536 が設定されている
現状は実験的なリリース
▼ 0-2. 参考リンク
公式のプロジェクト、モデルへのリンクです。
公式のリンクです。
NewBie-AI/NewBie-image-Exp0.1
https://huggingface.co/NewBie-AI/NewBie-image-Exp0.1NewBieAI-Lab/NewBie-image-Exp0.1
https://github.com/NewBieAI-Lab/NewBie-image-Exp0.1
ComfyUI がネイティブ対応する以前の情報です。プロンプトの書き方が参考になるかもしれません。サンプル画像にワークフローが含まれていて、プロンプトの抽出が可能です。
NewBie-image Deployment and Zero-Threshold Usage Tutorial (ENGLISH)
https://my.feishu.cn/wiki/NZl9wm7V1iuNzmkRKCUcb1USnshNewBie-image部署以及使用零门槛教程
https://my.feishu.cn/wiki/P3sgwUUjWih8ZWkpr0WcwXSMnTb
本記事で使用するモデル(詳細は後述)と、ComfyUI 公式のワークフロー等です。
Comfy-Org/NewBie-image-Exp0.1_repackaged
https://huggingface.co/Comfy-Org/NewBie-image-Exp0.1_repackagedComfyUI NewBie-image-Exp0.1 Workflow Example
ahttps://docs.comfy.org/tutorials/image/newbie-image/newbie-image-exp-0-1
■ 1. 留意事項と使用リソース量
▼ 1-1. 留意事項(お約束)
ComfyUI を更新していないと、必要なノードや機能が存在しない場合があります。バグフィックスを含むこともあるので、なるべく最新版にしてください。
状況に応じて、VRAM に読み込んだモデルが自動的にメイン RAM へ待避(オフロード)されることがあります。そのため、メイン RAM が多いとさらに快適に利用できる可能性があります。
▼ 1-2. 必要なリソースと生成時間
グラフィックボードの VRAM が 16GB の場合、あまり余裕が無い状態となりました。モデルのサイズからすると、メインRAM の空きが十分であれば 12GB でも支障なく動作すると考えられます。
筆者の環境(GeForce RTX 5060Ti 16GB)での、1枚当たりの生成時間です。初回は両者の合計となります。
5秒(モデル読み込みとテキストエンコード)
35秒(サンプリングのみ、20 Steps、CFG=5.5、1344x768)
■ 2. モデルの設置
▼ 2-1. Comfy Org版
本記事では Comfy Org が配布するバージョンを利用します。下記の URL に掲載されたそれぞれのファイルをダウンロードして、ComfyUI インストール先の内部にある適切なフォルダへ移動します。
Comfy-Org/NewBie-image-Exp0.1_repackaged
https://huggingface.co/Comfy-Org/NewBie-image-Exp0.1_repackagedsplit_files/diffusion_models/
NewBie-Image-Exp0.1-bf16.safetensors (6.49GB)
→ models\diffusion_models\split_files/text_encoders/
gemma_3_4b_it_bf16.safetensors (7.23GB)
jina_clip_v2_bf16.safetensors (1.04GB)
→ models\text_encoders\
上記には VAE が掲載されていないので、別のところからダウンロードします。
Comfy-Org/z_image_turbo
https://huggingface.co/Comfy-Org/z_image_turbosplit_files/vae/
ae.safetensors (319MB)
→ models\vae\
参考まで、newbie 等のフォルダを作成して分けておくと、各ファイルがどのアーキテクチャ向けのものか把握しやすくなります。
■ 3. 画像の生成(XML用)
▼ 3-1. 概要
ComfyUI で使用するワークフローと実行結果の画面などを掲載しています。
本記事では、XML構造化プロンプトの記述方法が中心となっています。自然文、Danbooruタグを使用したプロンプトの場合は 5. を参照してください。
▼ 3-2. ワークフロー(通常版)
生成用のワークフローを提供しますので、改造、再公開を含め自由にご利用ください。
こちらはプロンプト欄が1つのみです。分割されているバージョンは次項に掲載しています。
(Last update 2026-7-27)
ワークフローのファイルを ComfyUI の画面にドラッグ&ドロップして読み込み、「Run」をクリックすると生成が始まります。画像は ComfyUI インストール先の「output」フォルダに保存されます。
モデルの場所や名前が異なる場合は設定を変更してご利用ください。プロンプトや解像度は好みで変更してください。下記の実行例は本記事の表紙画像です。


参考まで、使用したプロンプトを掲載します。画像生成用としてはあまり見かけない形式であることが分かると思います。
You are an assistant designed to generate high-quality anime images with the highest degree of image-text alignment based on xml format textual prompts. <Prompt Start>
{
"character_1": {
"bbox": [
0,
0,
500,
1000
],
"name": "$character_1$"
},
"character_2": {
"bbox": [
500,
0,
1000,
1000
],
"name": "$character_2$"
},
"image": {
"tags": "<character_1>
<n>$character_1$</n>
<gender>1girl</gender>
<appearance>young_girl, brown_hair, twin_tails, amber_eyes, fair_skin, round_face, rosy_cheeks</appearance>
<clothing>yellow_hoodie, denim_shorts</clothing>
<body_type>short, petite, childlike_build</body_type>
<expression>bright_smile, open_mouth, cheerful_expression, looking_at_character_2</expression>
<action>sitting_on_bench, talking, relaxed_pose</action>
<interaction>chatting_with_character_2, sitting_side_by_side, enjoying_conversation</interaction>
<position>center_left, foreground, medium_shot, zoomed_in</position>
</character_1>
<character_2>
<n>$character_2$</n>
<gender>1girl</gender>
<appearance>young_girl, blonde_hair, short_bob_hair, blue_eyes, fair_skin, soft_face, rosy_cheeks</appearance>
<clothing>pink_cardigan, white_dress</clothing>
<body_type>short, petite, childlike_build</body_type>
<expression>gentle_smile, happy_expression, looking_at_character_1</expression>
<action>sitting_on_bench, talking, relaxed_pose</action>
<interaction>chatting_with_character_1, sitting_side_by_side, enjoying_conversation</interaction>
<position>center_right, foreground, medium_shot, zoomed_in</position>
</character_2>
<general_tags>
<count>2girls, multiple_girls</count>
<style>anime_style, colorful_digital_art, detailed_shading, soft_lineart</style>
<background>park_bench, green_trees, soft_greenery, blurred_park_background</background>
<environment>quiet_public_park</environment>
<perspective>eye_level, medium_shot, zoomed_in, character_focused_composition</perspective>
<atmosphere>cheerful, warm, wholesome, peaceful</atmosphere>
<lighting>bright_daylight, soft_sunlight, gentle_shadows, warm_color_tone</lighting>
<objects>wooden_bench</objects>
<other>simple_composition, reduced_background_details, subtle_depth_of_field</other>
<quality>masterpiece, best_quality, highres, absurdres, detailed</quality>
</general_tags>",
"caption": "An extremely detailed anime-style digital illustration features two young girls sitting side by side on a wooden bench in a quiet public park, shown in a zoomed-in medium shot with a character-focused composition. $character_1$ is positioned on the center-left in the foreground. She has brown twin tails, amber eyes, fair skin, rosy cheeks, and a round cheerful face. She wears a yellow hoodie and denim shorts. She sits in a relaxed pose, smiling brightly with an open-mouthed cheerful expression as she talks happily with $character_2$. $character_2$ is positioned on the center-right in the foreground. She has short blonde bobbed hair, blue eyes, fair skin, rosy cheeks, and a soft happy expression. She wears a pink cardigan over a white dress. She is also seated comfortably on the bench, turned slightly toward $character_1$ as they enjoy a lively and friendly conversation. The background is kept simple, with the bench surrounded by green trees and soft greenery in a lightly blurred park setting. The image is viewed from eye level, with unnecessary elements removed to keep attention on the girls’ expressions and interaction. Bright daylight, soft sunlight, and gentle shadows create a warm, peaceful, and wholesome atmosphere, rendered with detailed shading, soft lineart, and high-quality anime-style polish."
}
}▼ 3-3. ワークフロー(おまけ)
ComfyUI 公式のワークフローと互換性のある、プロンプト欄が2つのバージョンです。改造、再公開を含め自由にご利用ください。
(Last update 2026-7-27)
こちらは下記のプロンプト全文に対して、「{user_tags}」「{user_caption}」の部分のみが設定可能です。そのため、複数キャラクターが登場する場合の描画領域が定義できません。
You are an assistant designed to generate high-quality anime images with the highest degree of image-text alignment based on xml format textual prompts. <Prompt Start>
{
"character_1": {
"bbox": [
0,
0,
1000,
1000
],
"name": "$character_1$"
},
"image": {"tags": "{user_tags}",
"caption": "{user_caption}"
}
}ワークフローの全体と生成例です。左下に入力欄を2つ設け、実行時に全体のプロンプトが右下に表示されるようになっています。


参考まで、タグ欄とプロンプト欄の内容を掲載しておきます。
<character_1>
<n>$character_1$</n>
<gender>1girl</gender>
<appearance>pale_pink_hair, long_hair, ahoge, red_eyes, round_eyes, soft_face, youthful</appearance>
<clothing>large_hair_bow, stone_necklace, purple_wizard_dress, off_shoulder</clothing>
<expression>angry_smile, blush, open_mouth, cheerful_expression, looking_at_viewer</expression>
<action>raised_hands, lively_pose, upper_body_emphasis</action>
<position>upper_body, close_up, view_from_above</position>
</character_1>
<general_tags>
<count>1girl, solo</count>
<style>high_quality_shoujo_manga_style, premium_anime_illustration, soft_anime_style, pastel_colors, elegant_color_design, slightly_thicker_lineart, slightly_bold_lineart, ultra_refined_lineart, soft_shading, nuanced_shading, layered_shading, luminous_rendering, dreamy, cute</style>
<background>ruined_city, rubble, destroyed_buildings, small_fire_on_ground, starry_night_sky, simplified_background</background>
<environment>fantasy_ruins, ruined_city_at_night</environment>
<perspective>upper_body, close_up, view_from_above, character_focused_composition</perspective>
<atmosphere>magical, dreamy, whimsical, heartwarming, lively</atmosphere>
<lighting>moonlit_glow, magical_backlight, soft_dramatic_lighting, gentle_highlights, luminous_edge_lighting</lighting>
<quality>masterpiece, best_quality, ultra_highres, absurdres, extremely_detailed, refined_details, crisp_rendering, polished_finish, illustration_masterwork</quality>
<objects>magical_lightning_effect, floating_white_ghost, stuffed_ghost</objects>
<other>sparkling_effects, soft_glow, airy_feeling, shoujo_manga_tone, subtle_texture, fine_detail_emphasis, premium_finish, slightly_heavier_line_emphasis</other>
</general_tags>An extremely detailed, high-quality shoujo manga style digital illustration features $character_1$ in a close-up upper-body composition viewed slightly from above. $character_1$ is a young girl with pale pink long hair, a playful ahoge, and round red eyes, giving her a sweet and expressive appearance. She wears a large hair bow, a stone necklace, and a purple off-shoulder wizard dress, creating a charming magical-girl impression. She shows an angry yet cheerful smiling expression with blush on her cheeks and an open mouth, looking directly at the viewer. Her upper body is emphasized as she raises her hands in a lively and expressive pose, drawing attention to her face, hair, and costume details. The scene is set against a softly simplified ruined city at night, with hints of rubble, destroyed buildings, small fires on the ground, and a starry sky. Magical lightning effects, a floating white ghost, and a stuffed ghost add playful fantasy elements around her. The illustration is rendered with slightly thicker and more noticeable lineart while preserving a refined shoujo manga appearance, along with elegant pastel color design, layered and nuanced shading, luminous highlights, subtle texture, and a polished premium finish. A gentle moonlit glow and magical backlighting create a whimsical, airy, and heartwarming atmosphere while maintaining a luxurious high-quality visual style.■ 4. XML構造化プロンプトの生成
▼ 4-1. 概要
XML構造化プロンプトは、人間が直接記述することが難しいと思います。そのため、Claude や ChatGPT 等のチャット上でXML構造化プロンプトを生成するためのマニュアルを用意しました。
下記の概要は、筆者の案をもとに ChatGPT が加筆修正した内容を用いています。
マニュアルを添付して希望の内容を入力するだけで、適切なプロンプトを出力するようにした。また、誤って画像の生成が行われないよう対策を行った。
コードブロックで出力して、プロンプトをコピーしやすくした。
意図をくみ取り、入力内容が短くてもある程度詳細なプロンプトを考案して出力するようにした。
キャラクター、背景、構図、照明、雰囲気などを項目別に整理して出力するようにした。
不明な情報は無理に決めつけず、タグとキャプションの内容が矛盾しないようにした。
作者タグは指示しない限り含めない設計。
▼ 4-2. プロンプト作成マニュアル
主に ChatGPT を利用して作成しました。自由に参照、改造等を行ってください。使い方は次項で説明します。
下記の2つは、3-2. の通常版のワークフローで利用できる形式で出力します(入力するプロンプトの全文)。
【Basic 版】
通常はこちらを選んでください。プロンプト前段の「"character_n":」の部分が固定ですが、ComfyUI 公式のワークフローも同様の仕組みになっています。
(Last update 2026-7-27)
【Strict 版】
こちらは、プロンプト前段の「"character_n":」の部分が調整できます。これにより、複数キャラクターが登場する場合の描画領域が定義できます。XML構造化プロンプトの仕様を理解した上での利用を推奨します。
(Last update 2026-7-27)
【おまけ版】
こちらは、3-3. のワークフローや、ComfyUI 公式のワークフローで利用できる形式で出力します。「tags:」「caption:」の内容を個別に出力するので、ワークフローにてそれぞれの欄に入力します。
(Last update 2026-7-27)
▼ 4-2. プロンプトの生成1
前項のいずれかのファイルを ChatGPT、Claude、Gemini、Grok 等の新規チャットに添付して、どのようなイメージを作成したいかを入力します。
本項では Claude を利用した例を説明します。まだアカウントをお持ちでない場合も、Google アカウントがあれば簡単にサインアップできます。
執筆時点では、無料版の Claude はデフォルトで「Sonnet 5 中 + 思考」が選択されています。エフォートを小にして思考をオフにすることで、使用量の消費を抑えることができます。

前項のいずれかのファイルをドラッグ&ドロップすると添付されるので、好みの内容を入力して Enter を押します。
マニュアルでは、指示されていない内容まで勝手に決めてしまうようなことは行わせていません。そのため、「具体的に」の文言が全体にかかるように入力することで、プロンプトを少しだけ拡張させます。
ここでは「NewBie-image-Exp0.1_Prompt_Creation_Manual_Basic.txt」を添付して、「湖のほとりに立つカジュアルでかわいい服装の女の子の腰から上を写すシーンを具体的に考案」と入力してみます。

応答が返ったら、プロンプトの右上の角にマウスカーソルを移動してコピーすることができます。

最後に、ワークフローのプロンプト欄に貼り付けて画像を生成します。


参考まで、上記の画像が生成できるワークフローも掲載しておきます。
▼ 4-2. プロンプトの生成2
マニュアルはプロンプトの記述ルールが中心なので(プロンプトの作成指示はおまけ)、画像用のプロンプトや画像そのものを一緒に入力してプロンプトを生成することもできます。ただし、入力したものに対して依拠性が生じる可能性について認識しておいてください。
本項では画像を入力してプロンプトを取得します。画像とマニュアルを添付して、「画像の内容をプロンプトに変換します」と入力しました。学生風の服装のためか Claude がプロンプトの出力を拒否したので、代わりに Grok(https://grok.com/) を利用しています。

Grok が出力したプロンプトで生成した画像です。

入力画像は、2026年6月のメニュー表紙(雑多メモ2026より)です。瓜二つとまではいきませんが、かなり似通った内容であることが分かると思います。プロンプトだけでレイアウトや画像の内容を細かく制御できる点が、このアーキテクチャの大きな特徴だと考えられます。

■ 5. 自然文、Danbooruタグ向け
▼ 5-1. 概要
本記事では XML 構造化プロンプトを前提として書いていますが、通常の自然文やタグ形式も利用できます。4. と同様に、Claude や ChatGPT 等のチャット上でプロンプトを生成するためのマニュアルを用意しました。マニュアルの概要や使い方は 4. を参照してください。
▼ 5-2. プロンプト作成マニュアル
4-2. と同様に、主に ChatGPT を利用して作成しました。
(Last update 2026-7-27)
こちらはほとんどおまけなので、使用例は割愛します。基本的に、出力されるプロンプトの形式が変化するだけです。
■ 6. 最後に
▼ 6-1. 筆者より
25年12月の記事は生成手順が主だったので、プロンプトの作り方まで踏み込むことができませんでした。半年以上も空いてしまいましたが、その点をしっかりフォローできたと思います。
個性とポテンシャルを持ったアーキテクチャなので、新しいバージョンの登場を切に願っているところです。
■ 7. その他
私が書いた他の記事は、メニューよりたどってください。
ComfyUIに限定した記事の一覧もあります。
記事に関することで何かありましたら、Xの@riddi0908までお願いします。
