🧰 UtlKit

AI画像プロンプトの書き方:T2Iの構成、ビジュアル語彙と具体例

テキスト→画像(T2I)モデル向けの画像プロンプトの書き方。8つの構成要素、画像モデルが反応するビジュアル語彙、完成例、よくある失敗を解説。

プロンプトがすべてを決める理由

テキスト→画像(T2I)モデルはあなたのアイデアを「理解」しません——入力した言葉を、訓練に使われた数十億枚の画像のパターンと照合しているだけです。プロンプトはモデルが受け取る唯一の指示であり、言い方のわずかな違いが描かれる画像を変えます。「公園の犬」と「芝生の公園でテニスボールを飛びついて取るボサボサのテリア、木漏れ日、85mm レンズ、浅い被写界深度」では、同じモデルでもまったく異なる 2 枚が生まれます。

本ガイドでは機能する構成を解説します:8 部構成の T2I プロンプト、画像モデルが反応するビジュアル語彙、使うモデルにあわせた調整法、そして結果を平凡にするよくある失敗です。

8 部構成の T2I プロンプトの型

強い T2I プロンプトは、おおむねこの順で 8 つの問いに答えいます:

  1. 被写体——フレームの中にある人物やもの。具体的に(「人」ではなく「キャンバスジャケットの荒れ海で鍛えられた漁師」のように)。
  2. ディテール——被写体を具体的にする素材や質感:織物の目、毛並み、肌、金属の経年変化。
  3. シーンと時間——場所と空気:路地裏、スタジオ、海岸線。時間と天候はどのスタイル語よりも彩りを左右します。
  4. 構図——フレームの組み方:三分割法、センタリング、リーディングライン、ネガティブスペース、枠の中の枠。
  5. ライティング——光の質:ゴールデンアワー、リムライト、ゴッドレイ、ネオン、キャンドルの灯り、スタジオの柔光、明暗チャイアスコゥーロ。
  6. カラー——パレットの方向:ティール&オレンジ、マットなアースカラー、パステル、モノクロ、ジェムトーン。
  7. スタイル・媒体・ムード——ビジュアル言語(フォトリアリスティック、シネマティック、アニメ、油絵、ピクセルアート)と感情のトーン(ドラマチック、穏やか、物憂げ)。
  8. カメラとフォーマット——ショットサイズ(クローズアップ、全身、超ワイド)、焦点距離(35mm、85mm)、アングル、実際に必要なアスペクト比。

完成例

上記の 8 部で組み立てたフォトリアリスティックな人物像:

"日焼けで荒れた肌の老漁師、塩で白んだキャンバスジャケット、小さな防波堤の端に立つ、夜明け前の水面に霧が立ち上る、上部に余白のあるセンタリング構図、左からのやわらかなゴールデンアワーの光、マットなアースカラー、フォトリアリスティックな写真、物憂げなムード、85mm ポートレートレンズ、ミディアムクローズアップ、4:5"

数えてみてください:被写体、質感、場所、時間、霧、構図、光、カラー、スタイル、媒体、ムード、焦点距離、ショットサイズ、フォーマット——14 の要素。各節が 1 つずつ役割を果たし、装飾はひとつもありません。最後に「超詳細なディテール、自然なライティング」といった短い品質フレーズを添えると、モデルは品質目標として読み取ります。

画像モデルが理解するビジュアル語彙

画像モデルは技術用語でアノテーションされた写真や美術作品で学習しているため、標準的な専門用語が効きます。最もよく使うもの:

  • ショットサイズ——エクストリームクローズアップ、クローズアップ、ミディアムショット、フルショット、ロングショット、エクストリームワイド、真上からの俯瞰、オーバーザショルダー、ツーショット。
  • アングル——アイレベル、ローアングル、ハイアングル、真上からの鳥瞰、地面レベルからの上望み、ダッチアングル、POV(主観視点)。
  • 焦点距離と被写界深度——24mm ワイド、35mm スリート、50mm、85mm ポートレート、135mm テレ、マクロ 1:1。クリーミーな f/1.4 ボケの浅い被写界深度、または f/16 の全領域シャープ描写。
  • ライティング——ゴールデンアワー、ブルーアワー、バックライト、リムライト、ボリューметриク光、ゴッドレイ、ネオン、キャンドルの灯り、月明かり、ハイキー、ローキー、レンブラント光、チャイアスコゥーロ、ドラマチックな陰影。
  • フィルムと質感——35mm フィルム写真、Kodak Portra 400、フィルム粒、ライトリーク、コンパクトカメラの直フラッシュ、VHS スチル。
  • 美術媒体——インパストの油絵、水彩、炭筆スケッチ、インクの線画、色鉛筆、ピクセルアート、アイソメトリック、セルシェーディングのアニメ、コミックのハーフートーン、ポップアート、浮世絵木版画、グリッチアート。

すべてを書く必要はありません。「85mm ポートレートレンズ、浅い被写界深度」や「インパストの油絵」のような 1〜2 つの技術的な選択は、スタイル形容詞 3 語より結果を大きく動かすことがあります。

使うモデルにあわせてプロンプトを調整する

主要な画像モデルはそれぞれ異なるラボから出ています:Midjourney V7(Midjourney)、DALL·E 3(OpenAI)、Flux.1(Black Forest Labs)、Imagen 3(Google)、Stable Diffusion 3.5(Stability AI)、加えて中国発の Seedream(ByteDance)、Kolors(Kuaishou)、Wan と Z-Image Turbo(Alibaba)、MiniMax Image、ERNIE ViLG(Baidu)です。プロンプト戦略は実用上 2 点で異なります:

  • 言語。中国発のモデルは中国語が母語——中国語プロンプトが最も自然に読まれます。残りは主に英語で学習されています。モデルが最も強い言語で書きましょう。
  • 品質フレーズ。モデルごとに好まれる締めくくりフレーズがあります——Flux.1 は "photorealistic, accurate detail"、Midjourney V7 は "cinematic, highly detailed, artistic composition"。正しいものを添えると、同じ選択肢でもそれぞれのモデルにとってネイティブなプロンプトに読み取られます。

AI画像プロンプトジェネレーターは両方を自動処理します:出力言語をモデルに合わせ(中国語ページの中国語モデルは中国語、それ以外はすべて英語)、各モデル独自の画質サフィックスを追加します。

AI 画像を平凡にする 7 つの失敗

  • 曖昧な被写体。「どこかにいる人」では出演者をモデル任せにします。フレームの中の対象を具体的に。
  • スタイルの衝突。「フォトリアリスティックな油絵」は自己相殺になります。ビジュアル言語はひとつに決め、貫きましょう。
  • ライティングの意図がない。光の方向を指定しないと、モデルは平坦で中性的なカタログ調の光が既定になります。光を名指しで。
  • 形容詞の羅列。スタイル語 20 個はすべての指示を薄めます。具体的な記述 10 個が形容詞 50 個に勝つことはよくあります。
  • 言語の混合。プロンプトは 1 言語に。半分だけ翻訳したプロンプトはモデルを混乱させます。
  • アスペクト比を無視。壁紙、バナー、表紙にデフォルトの正方形は不向きです。最初に 16:9、4:5、3:2 を宣言しましょう。
  • 否定文で済ませる。「ブレない、指が余らない」より、欲しいものを描くほうが確実です:ピントが冴える、手がきれいに描ける、被写体はひとつ。

構成でプロンプトを組み立てる

フリーテキストを書く代わりに、構造化グリッドからオプションを選ぶ方法があります。AI画像プロンプトジェネレーターは 10 カテゴリ——被写体のタイプ、シーン、構図、ライティング、カラーパレット、アールスタイル、媒体、ムード、カメラ、アスペクト比——をカバーし、全オプションに参考画像を付けたうえで、カテゴリ毎の単一選択を対象モデル向けの 1 つのプロンプトに組み立てます。すべてブラウザ内で動作します:書き入れた内容はアップロードされません。

関連ツール

よくある質問

テキスト→画像(T2I)プロンプトとは?

画像モデルに「何を描くか」を伝える言葉の束です:被写体に加え、シーン、構図、ライティング、カラー、スタイル、カメラ、アスペクト比といったビジュアル指示。検索クエリと違い、語順と具体性が効きます。記述が具体的で、前に置かれるほど、モデルは重みを置いてきます。

AI画像プロンプトには何を含めるべき?

8 つの要素:具体的な被写体、質感・素材のディテール、時間付きのシーン、構図、ライティング、カラーパレット、媒体とムードを伴うスタイル、アスペクト比を伴うカメラ。1 言語で具体的記述 30〜80 語程度にまとめ、短い品質フレーズで締めくくりましょう。

AI画像プロンプトはどのくらいの長さが適切?

モデルによります。Midjourney と DALL·E は簡潔なプロンプト(約 20〜40 語)に最もよく反応し、Flux や Stable Diffusion は詳細を好んで 100 語超でも処理できます。目安としては、具体的で曖昧でない記述 30〜80 語が最適です。200 語のパラグラフは通常、効果が悪くなります。

モデルごとに(Midjourney、DALL·E、Flux など)異なるプロンプトが必要?

核心の記述は同じで構いませんが、2 点は調整すべきです:言語(Seedream、Kolors、Wan、Z-Image Turbo、MiniMax Image、ERNIE ViLG などの中国発モデルは中国語プロンプトへの応答で訓練されています。残りは英語に最も反応します)と、モデルごとに異なる締めくくりの品質フレーズ。構造化ジェネレーターは両方を自動処理します。

なぜAI画像は凡庸で、色が薄い仕上がりになるの?

多くの場合、プロンプトが大きな決断をモデルに任せています。光を名指しで(平坦で中性的な光が黙示のデフォルトです)、スタイルはひとつに決めて競合する形容詞を削り、レンズ、ショットサイズ、フィルムなどの技術的詳細を 1〜2 つ加え、アスペクト比を宣言しましょう。具体的記述 10 個が形容詞の羅列に勝つことはよくあります。

関連記事