AIでYouTubeサムネイルはつくれるのか。本番で背景を描かせ続けて分かった、できることとできないこと

つくれます。ただし「1枚まるごと」と「絵だけ」でできることが違い、同じ絵は二度と出ません。

この記事の数値は に測ったものです。

先に結論

  • つくれます。打った言葉から絵の題材を考えて背景を描くところまで、AI に任せられます。 待ち時間は1枚30〜60秒でした。
  • ただし「1枚まるごと描かせる」と「絵だけ描かせる」で、できることが違います。文字まで描かせると、位置も大きさも改行もこちらが決められません
  • 同じ指示から同じ絵は二度と出ません。気に入らないところだけ直す、ということができません。
  • 「外れたら引き直す」は思ったほど効きません。同じ言葉から引いた2枚は、だいたい同じ内容でした。外れるときは揃って外れます。
  • 実在するものは描けません。ゲームの画面や特定の商品は、AI ではなく自分の画像を使うほうが早いです。

どう測ったか

画像生成モデルは Gemini 3.1 Flash Image、横長16:9。 この記事の数字は、AI に背景を描かせる仕組みを本番で回しながら、 日を分けて測ったものです。どれをいつ測ったかを先に書いておきます。

測ったことやり方測った日
同じ言葉から出る2枚の差本番で16枚つくり、2枚ずつ並べて見比べた2026年8月17日
1枚にかかる時間本番の記録から、成功した回の所要時間を読んだ2026年8月24日・26日
指示の一語がどれだけ絵を決めるか題材を考える段階だけを108回回して、出てきた場所と時間帯を数えた2026年8月27日
日本語の文字を描かせたときの出方同じ指示で5回引いて、誤字と行の割れ方を見た(8枚)2026年9月3日
4K で描かせたときの時間と寸法4K 指定で5回引いて、秒数と返ってきた画像の寸法を記録した2026年9月3日

「AIでサムネをつくる」には2通りある

ここを分けずに話すと、話が噛み合いません。どこまでを AI に描かせるかで、できることが変わります。

やり方AI が描くもの得意なこと困ること
1枚まるごと背景も、文字も、人物も頼めば1回で「それらしい1枚」が出る文字の位置・大きさ・改行を決められない。打ち替えると絵も変わる
絵だけ背景の絵だけ(文字は描かせない)文字は自分で置くので読めるかどうかを決められる。打ち替えても絵は変わらない文字を乗せる工程が別に要る

以下は「絵だけ」のやり方で測った数字です。 「1枚まるごと」で文字まで描かせたときに何が起きるかは、「AIに日本語の文字を描かせると化ける、は本当か」に実物を載せています。

できること1:打った言葉から、絵の題材を考える

AI に渡すのは「こういう絵を描いて」という文です。 その文を人が毎回書くのは手間なので、サムネイルに入れる言葉を先に読ませて、AI 自身に題材を考えさせる段階を挟んでいます。文字を書くモデルは画像のモデルよりずっと安いので、ここは負担になりません。

「登録者100人の壁/越えられない人へ/原因は3つだけ」という言葉から描かれた、昼下がりのシェアオフィスの背景に文字を乗せたサムネイル
「登録者100人の壁/越えられない人へ/原因は3つだけ」と打ったときの1枚。 AI が考えた題材は「昼下がりの活気あるシェアオフィス」でした。 言葉に場所は書いていませんが、「登録者」「壁」から働く場所を連想しています。

いつもこう当たるわけではありません。言葉から題材へ、題材から絵へ、と2段階で AI が考えるので、どちらの段でもずれます。 ずれたときに「どの言葉がどう読まれたか」が分かるように、 考えた題材そのものを画面に出すようにしています。

できること2:1枚30〜60秒で返ってくる

項目実測
1枚の所要時間(人物なし)26.6秒
1枚の所要時間(人物の写真を合成)59.8秒(人物の縁取りで +16秒ほど)
文字を乗せる合成1秒未満

時間のほとんどは背景の生成です。 画像モデルの利用料は公開されていて、自分で直接使えば1枚15円ほどです。 なおいつも成功するわけではありません。 本番で12回のうち2回、AI が返事をせずに時間切れになった日がありました。最長で270秒待たせています。 いまは一定時間で打ち切って「失敗」と伝えるようにしていますが、AI 側の応答は、こちらでは速くできません

できること3:4K でも描ける。ただし寸法は指定どおりに返らない

YouTube が推奨する 3840×2160 で出せるか試しました。5回とも80秒以内に返り、2〜5回目は29.8〜34.2秒で、 2K とほとんど変わりませんでした。1回目だけ69.3秒でした。

意外だったのは寸法です。「4K」と指定して返ってきたのは5504×3072(約10MBのJPEG)で、3840×2160 ではありません。 「4K」はこのモデルへの入力の名前であって、返ってくる寸法の約束ではないようです。 使うときは自分で 3840×2160 に整えることになります。 YouTube 側の上限(スマホからの投稿は 2MB)は「YouTubeサムネイルのサイズ」にまとめてあります。

できること4:日本語の見出しも、この日は誤字なしで出た

「AI は日本語の文字が描けない」とよく言われますが、 2026年9月3日にこのモデルで試した限りでは、見出しの誤字は7枚で0でした。 崩れたのは絵の中の小さい文字(パソコンの画面や看板)で、 それは日本語も英語も同じでした。

では文字まで描かせればいいかというと、そうはなりませんでした。 理由は次の「できないこと」です。

できないこと1:同じ指示から、同じ絵は二度と出ない

まったく同じ文を5回渡したら、5枚とも違いました。文字まで描かせた回では、行の割れ方が2行の回と3行の回に分かれ、 文字の色も白だったり黒だったり、頼んでいないのに2色に塗り分けられた回もありました。

これは誤字より困ります。誤字なら出た回だけ引き直せば済みますが、ばらつきは引き直しても直りません。 「絵はいいのに文字の割れ方だけ嫌だ」というとき、 文字だけ直す手段が無く、引き直すと絵も別物になります

できないこと2:「外れたら引き直す」が効かない

当初は「AI が外れたときのために、同じ言葉で2枚引いて選ばせよう」と考えていました。 本番で16枚つくって2枚ずつ見比べたところ、同じ言葉から出る2枚は、だいたい同じ内容でした。 どちらもよい、またはどちらも外れ、のどちらかです。

考えてみれば当然で、2枚は同じ言葉・同じ指示から引いています。 独立した2回のくじではなく、強く相関した2回です。 枚数を増やしても当たりの確率は上がらず、費用だけ2倍になるので、いまは1枚だけ引いて、ぼかしの有無で2つに分けています

できないこと3:指示の一語で、場所と時間帯が決まってしまう

「熱量のあるにぎやかな雰囲気」のつもりで指示に「夜」と入れていたら、 題材が12回中8回、夜の繁華街になりました。 打った言葉に「三脚」と具体的な物があっても、夜の街へ連れて行かれます。 「夜」を抜いたら夜は12回中0回になり、 打った言葉の物が絵に出る回が12回中5回から11回に増えました。

指示の一語が、打った言葉より強いということです。 雰囲気を伝えるつもりの一語が、場所と時間帯を決めてしまいます。 この切り分けは絵を1枚も引かずに、題材を考える段階だけを108回回して測りました。 文字のモデルだけなので、108回でも画像1枚ぶんに届きません。詳しくは「AIにサムネイルの背景を描かせると同じ絵ばかり出るのは、たいてい指示のせい」に書きました。

できないこと4:実在するものは描けない

ゲームの画面、特定のキャラクター、実在の商品は、AI では再現しきれません。 似た何かは出ますが、そのゲームを知っている人には違和感が出ます。 ゲーム実況なら実際のゲーム画面を、商品紹介ならその商品の写真を、自分の画像として背景に使うほうが確実です。 AI が向いているのは、解説や考察のように「正解の姿が無い」題材です。

「AI でつくったと分かると、嫌がられる?」

この問いは、Yahoo!知恵袋に「サムネにAIが使われていると、どう感じますか」という形で立っていて、多くの共感を集めていました(2026年5月)。

視聴者がどう感じるかは測っていないので、ここでは答えません。言えるのは作り方の話だけです。 「絵だけ」のやり方では、AI が描いているのは背景で、顔と文字は AI ではありません。 顔写真は本人のものをそのまま切り抜いて置き、文字はプログラムが置きます。 AI 特有の不自然な顔や崩れた文字が出ない作り方はある、というところまでです。

自分で AI に描かせるなら

  • 絵と文字を分ける。AI には文字のない絵だけを頼み、文字はあとから乗せます。 「文字を置くので空けて」ではなく「左半分は明るく平坦に」と、見た目の性質で頼みます。
  • 1枚で判断しない。同じ指示で3〜5枚引いて、ばらつきの幅を見てから決めます。
  • 指示に時間帯や場所の種類を入れない。「夜」「室内」のような一語が、打った言葉より強く効きます。 雰囲気は色で伝えます(「ネオンの色」は色なので大丈夫でした)。
  • 同じ言葉で引き直しても、だいたい同じ絵が出ると思っておきます。 変えたいなら、指示の語を変えます。
  • 実在するものは自分の画像で。AI に頼むのは、正解の姿が無い題材だけにします。
  • 4K は要るときだけ。時間はほぼ変わりませんが、返ってくる寸法は自分で整えることになります。 上げたあとに YouTube が何を配るかは「サムネイルを4Kで上げる意味」で測りました。

ここに書いた数字はその日にそのモデルで測った記録です。 画像生成モデルは入れ替わりが速いので、この記事もそのまま信じず、 自分の使うモデルで数枚引いてみるのがいちばん早いと思います。 言葉から絵を考える仕組みそのものはつかいかたの「絵は打った言葉から考えます」に、実例つきで書いてあります。