- Qwen-Imageシリーズ第3世代の基盤画像生成モデルで、見栄えのよい画像にとどまらず、生産性タスクに活用できる「Real(实)」を中核目標に据える
- 最大4.5kトークン入力を処理し、新聞・ストーリーボード・試験用紙のような情報量の多いレイアウトや、複数の概念が並列・重層的に含まれる画像を一度に生成する
- 10pxサイズの文字やLaTeX数式、手書き注釈を読めるようにレンダリングし、毛穴・髪の毛・肌・筆致のような微細な質感も再現する
- 12言語と複数のフォント、100以上のアートスタイル、Web・ゲーム・ライブ配信UIをサポートし、インターネットで最新情報を検索して画像に反映することもできる
- 新聞PDF、ショートドラマのストーリーボード、複雑なUIをはじめ、デザイン・コンテンツ制作・教育・ECにおいて、画像生成を展開可能な生産性ツールへ拡張しようとするモデル
「Real」を目指す第3世代モデル
- Qwen-Image-3.0はQwen-Imageシリーズの第3世代基盤画像生成モデル
- 世代ごとの中核的な方向性は次のとおり
- Qwen-Image-1.0: Precision
- Qwen-Image-2.0: Precision, Variety, Completeness, Beauty, Authenticity
- Qwen-Image-3.0: Real(实)
- 「Real」は3つの能力で構成される
- 豊富なコンテンツ: 最大4.5kトークン入力と複雑なレイアウトに対応
- リアルなディテール: 10px文字や毛穴・髪の毛のような微細要素を再現
- 深い知識: 12言語、多様なUI、世界知識を活用した生成
- 画像生成を「使える」から「実用的」へ、「見栄えがよいもの」から役に立つものへ発展させることを目標にする
豊富なコンテンツと複雑な配置
- 数学スライドで、空間関係、数学記号、定理の説明、各要素の相対的な位置をまとめてレンダリングできる
- 約3.7kトークンの指示文で、複数画像をつなぎ合わせることなく、1つの3×3グリッドを単一パスで生成する
- 各セルは中国語・英語の文章、数式、チャート、漫画キャラクターを組み合わせた複雑なインフォグラフィックで構成される
- トンネル安全漫画、空間幾何学の授業、『出師表』の文体分析、放物線運動、寄生虫学、右胸痛の医学図表、Sylowの定理、銀行の内部統制、細胞DNA構造比較を1枚の画像に配置する
- 最大4.5kトークンの指示文を受け取り、情報密度の高い視覚レイアウトを理解してレンダリングする
-
水平方向の拡張
- 単一キャンバスに複数の並列要素を配置する能力を指す
- 意味的な並置と空間制御を活用し、複数の概念が互いに干渉しないよう整理する
-
垂直方向の深さ
- 意味を分解し、論理的に重なり合うインターフェースを段階的に表現する能力
- 単一の指示文で、VSCodeのプログラミング画面、Qwen Chat、WeChat、ハンドドリップコーヒーのポスターが重なったマルチスクリーン構造を生成する
- 各レイヤーは該当UIのスタイルと細部要素を保つ
小さな文字から絵画修復まで
-
小さな文字と複雑な組版
- 10pxサイズの小さな文字も読めるようにレンダリングする
- ジンベエザメの知識インフォグラフィックのように、文章とイラストが多い領域をまとめて生成できる
- 代数幾何学論文の1ページで、LaTeX数式、上付き・下付き、ギリシャ文字、定理番号、中括弧、分数線、複数行の整列を再現する
- 小さなフォントでも数式と本文の可読性を維持する
- リアルな紙の質感と高密度のテキストを組み合わせ、新聞形式の画像を生成する
-
編集と手書き文字
- 本のページ上に赤色の手書き注釈を追加できる
- 下線、波線、丸、矢印、短いメモを含む
- 高校生の授業ノートのような自然な手書きスタイルを実現する
-
質感表現と修復
- 人物写真で毛穴、髪の毛、肌の質感のような微細要素を描写し、他の物体の繊細な質感も表現できる
- 損傷したり一部が失われたりした伝統絵画を、元の画風と筆致に合わせて修復する
- ワシの戦闘画における墨の濃淡、羽毛の質感、構図のバランスを保ちながら、カビのシミや損傷跡を除去し、欠落部分を補完する
言語・UI・世界知識の活用
- 12言語と複数のフォント、100以上のアートスタイル、多様なUIインターフェースをサポートする
- 日本語・韓国語・スペイン語を正確にレンダリングする事例が含まれる
- Webページ、ゲーム、ライブ配信など、さまざまな種類のリアルなUI画面を生成できる
-
知識ベースのインフォグラフィック
- 実際の昆虫写真の主要被写体を維持しながら、研究用インフォグラフィックへ拡張する
- 分類学情報、形態的特徴の注釈、拡大詳細画面、スケールバーを含む
- 出力結果を学術出版にそのまま使える研究図表の形式で構成する
-
最新情報とIPの活用
- モデルが持つ知識だけでなく、インターネットに接続して最新情報を検索できる
- 7月21日のHangzhouの天気を検索し、天気予報画像を生成する
- 特定のIP人物を探し、それをもとに画像を作成できる
- Qi BaishiとVan Goghがライブ配信ルームでQwen-Image-3.0を紹介する場面を生成する
生産性タスクへの拡張
- 3つの中核能力をもとに、新聞PDF、ショートドラマのストーリーボード、複雑なUIインターフェースのような高価値タスクを支援する
- 画像生成能力を、デザイン、コンテンツ制作、教育、ECなど、より多くの分野の生産性価値へつなげることを目指す
1件のコメント
Hacker News のコメント
オンラインショッピングにこうしたモデルを押し込むのは奇妙に感じる。服が体に合って見えるよう補正し、照明まで見栄えよくするため、実際の服の着心地やフィット感は導入前と同じく分かりにくい
50年後には「広告の真実性」そのものが、取り戻せない理想的な過去と見なされるかもしれない
ただ、毎月新商品が1,000点ずつ掲載されるプラットフォームなら、実際の不完全な写真のほうが購入コンバージョンにも有利そうだ。特にすべてのカラーバリエーションが同じに見える3D風の画像は、むしろ抵抗感がある
HTML のメタキーワードに hentai、nudes など成人向けコンテンツ関連の項目が100個以上入っていて興味深い
コンソールで
document.querySelector('meta[name="keywords"]').contentを実行すると、タグ全体を見られるqwenを含む一般的な検索語を集める中で、成人向け文脈のgwenやbenのタイプミスまで含めた可能性があるkeywordsメタタグにどんな価値があるのか分からないし、77KB以上の無駄なデータをページに足しているだけだGPT Image 1 の出力で学習したように見え、特有の黄色い色調がはっきりしている
https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...
https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...
https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...
https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...
代表画像タイトルのアラビア語は明らかに壊れているが、実際にモデルを使うとそうではない。代表画像は Qwen Image 3.0 で生成されたものではないのかもしれない
「3×3グリッド全体を正確に描写するには3,700トークンが必要だ」としているが、プロンプトを公開していないためデモの説得力が落ちている
重みの公開時期と有無に関する内容がまったくないが、どこか別に書かれているのか気になる
実際のロゴ2つ、完全なデザイン言語仕様、アプリケーション画面のスクリーンショット3枚を提供したが、ひどい画像が3枚出てきただけで、どれも渡した元のロゴと同じではなかった
chat.qwen.ai で試した結果、構図も解剖学的正確性もQwen Image 1 レベルにすら達していない。脚が3本だったり目が光ったりする結果が出て、撤回された Microsoft Lens 程度の品質だ
大学時代にこういうモデルがあったらよかったと思う。視覚的に学ぶタイプとして、長い文章よりも図解や説明イラストを通じて一部のテーマをはるかに簡単に理解できただろう
Nano Banana 2 に「原子の仕組みを説明する学部生向けインフォグラフィックポスター」を依頼してみたところ、中学校の理科教科書のようなボーア模型が生成された
依然として画像のあちこちに黄ばんだフィルターが残っている