画像生成・編集AI「Qwen-Image-2.1」が無料のオープンモデルとして登場したので使ってみた、日本語プロンプト対応&透過PNG画像も生成可能
親愛なる読者の皆さまへ。ご存じの通り価格高騰などの悪影響でサーバー運営がとても苦しい状態です。回線や台数を整理し見直せる部分は全て見直しましたが、やはりまだ危険水域です。このままだと1ページを10分割ぐらいして無理矢理PVを増やさざるを得なくなってしまいます。そこで、GIGAZINEの物理的なサーバーたちを、たった1円でも良いので親愛なる読者の皆さまに支援してもらえればとっても助かります!今すぐ寄付は上のボタンから! ・ これまでGIGAZINEを支援してくれたメンバーのリスト
中国企業のAlibabaが画像生成AI「 Qwen-Image-2.1 」を2026年9月20日に公開しました。Qwen-Imageシリーズとしては久しぶりのオープンモデルで、無料でダウンロードしてComfyUIなどの実行環境で画像生成および編集を実行可能。「透過PNG作成機能」や「複数の参照画像をもとにした画像生成機能」などを備えているとのことなので、実際にPCでローカル実行してみました。 Qwen-Image-2.1: Compact, Efficient, and Unified Image Creation https://qwen.ai/blog?id=qwen-image-2.1 Qwen/Qwen-Image-2.1 · Hugging Face https://huggingface.co/Qwen/Qwen-Image-2.1 Qwen-Imageシリーズは初期の頃はオープンモデルとしてリリースされていましたが、2026年2月登場の Qwen-Image-2.0 や2026年7月登場の Qwen-Image-3.0 はクローズドモデルとして展開されました。今回登場したQwen-Image-2.1はバージョンが逆戻りしたものの、オープンモデルとして公開されており、無料でダウンロードしてローカルで実行することができます。 Alibabaが公開した「各種画像生成AIのベンチマークスコアとパラメーター数をまとめた図」が以下。Qwen-Image-2.1は2026年1月に登場した Qwen-Image-2512 より小さい70億パラメーターのモデルですが、クローズドモデルであるGoogleの Nano Banana 2.0 やOpenAIの GPT-Image-1.5 より高性能とされています。
すでにComfyUIで使用可能になっているので使ってみます。まずテンプレート一覧から「Qwen Image 2.1:テキストから画像へ」を探してクリック。
diffusion modelの「 qwen_image_2.1_int8_convrot.safetensors 」、テキストエンコーダーの「 qwen3vl_8b_int8_convrot.safetensors 」、VAEの「 qwen_image_2.1_vae_bf16.safetensors 」をダウンロードするように促されるので「すべてダウンロード」をクリックします。
ダウンロードが完了したらComfyUIを再起動もしくは画面更新。続いて、プロンプト入力欄に画像の説明を入力して「実行する」をクリックすると画像を生成できます。プロンプトは日本語でもOKです。
『写真。室外機に座るメイドさん。日本人女性。髪の毛は赤色のウルフカット。ロリポップキャンディをくわえながら新聞を読む。新聞の見出しは「GIGAZINE」で、「画像生成AI Qwen-Image-2.0が登場」と書かれている』というプロンプトで生成した画像が以下。人間がかなりリアルなのが特長的。一方で、新聞の文字の指示は守れておらず、室外機も歪んでいます。
同じプロンプトでシード値を変更して生成。「画像生成AI Qwen-Image-2.0が登場」というテキストが正しく反映されました。ChatGPTやGeminiなどのオンラインサービスと比べると品質が低めですが、生成回数が無制限なのでシード値を変更しながら何度も生成していると「当たり」の画像を生成できることがあります。
参考までに、「グラフィックボード: Intel Arc Pro B70 Creator 32GB 」「CPU:AMD Ryzen 5 7600X」という構成のPCを使って「解像度:1024×1024ピクセル」「ステップ数:25」という設定で生成した結果、初回の画像生成に約45秒、2回目以降は約30秒かかりました。
Qwen-Image-2.1は透過PNG画像の生成にも対応しています。特に複雑な設定は必要なく、プロンプトに「透過PNG」などのワードを含めればOKです。
『透過PNG。デフォルメされたメイドさんの全身イラスト。髪の毛は黒色のショートカットで、オレンジ色の「G」という形状のヘアピンを着用。直立して正面を向いた姿勢。背景は透過』というプロンプトで生成した画像が以下。以下の画像は記事用に縮小して透過状態が失われていますが、画像をクリックするとオリジナルの透過PNG画像を確認できます。
Qwen-Image-2.1の画像編集機能も試してみます。ComfyUIのテンプレート一覧にある「Qwen Image 2.1:画像編集」を探してクリック。
元画像とテキストプロンプトを入力して生成します。今回は AlibabaのQwen-Image-2.1発表ブログ に掲載されているアイキャッチ画像と、先ほど生成した透過PNG画像とともに『大きな会場での製品発表会の様子。1枚目の画像を大型スクリーンに表示。プレゼンターは2枚目の画像のメイドさん。メイドさんが舞台に立って大型スクリーンを指さす。メイドさんのセリフとして「スゴイ!」という吹き出しをつける』というテキストを入力しました。
生成結果はこんな感じ。「スクリーンが湾曲しているのに、文字が湾曲していない」「アイキャッチ画像の左側の構造体が崩れている」といった問題はあるものの、おおむね指示通りです。
ただし、上記のプロンプトでは成功画像が出る確率が低く、何枚も生成して成功画像を選ぶ必要がありました。失敗画像の例はこんな感じ。ローカル画像生成界隈では「LLMを使ってプロンプトを画像生成AIに適した形に整形する」というプロンプトエンハンサーを用いる手法が流行しているので、Qwen-Image-2.1でもプロンプトエンハンサーの使用を検討するのが良さげです。
この要約はメディアの公開フィードから5Newsが集約したものです。 文脈も含めた全文はgigazine.netにあります — コンテンツの権利はGIGAZINEに帰属します。