「ローアングルで」では、AIはカメラを下げてくれない。

GENERATIVE AI / VISUAL DIRECTION
プロンプトを駆使してついに描かれた奇跡の1枚

画像生成AIを思い通りに操るには、どう指示すればいいのか。
いろいろ試していたら、いつの間にか私は、
癖の強い撮影チームの監督になっていた。

画像生成AIで、女性をローアングルから描いてみたかった。だから、「もっと低い位置から見上げて」と頼んだ。するとAIは、カメラを下げなかった。机を高くした。そう来たか。

「ローアングル」を成立させようとした結果。こちらが動かしたかったのはカメラである。

 

こちらとしては、カメラの位置を変えてほしかっただけだ。
しかしAIは、人物とカメラの関係を変える代わりに、
世界のほうを作り替えて条件を成立させた。

このあたりから、画像生成AIへの興味が少し変わってきた。

どうすれば言うことを聞かせられるのか。

というより、

この人たち、いったいどういうつもりで画を作っているんだろう。

そちらのほうが気になり始めた。

そもそも、何をやっていたのか

画像生成AIをあまり触ったことがない人のために、
先に今回やっていたことを説明しておきたい。

やっていること自体は、それほど難しくない。

AIに文章で、
「冬の街角に立つ女性を描いて」
「もう少し低い位置から見上げたい」
「病室で、横になっている人から看護師を見るような画にしたい」
といった指示を出す。

こうした画像生成AIへの指示文を、一般に「プロンプト」と呼ぶ。

ちなみに今回、画像そのものを作るために使ったのは、
ChatGPTやGeminiの画像生成機能ではなく、
Stable Diffusionという画像生成AIだ。

ChatGPTやGeminiなら、会話の中で「こんな画像を作って」と頼めば、
相談から画像生成までかなり一体化して進められる。
Stable Diffusionはそれとは少し毛色が違って、
使うモデルや生成時の設定などを自分で選びながら試せるぶん、
少しマニアックで、撮影機材をいじるような楽しさがある。

今回の役割分担を乱暴に言えば、
ChatGPTには相談相手になってもらい、Stable Diffusionには撮影してもらった。

まず日本語で「こういう画にしたい」と相談し、
その意図を画像生成向けの英語のプロンプトへ整理してもらう。
それをStable Diffusionに渡し、出てきた画像を見て、
また日本語で相談する。

だから、ひとつのAIに全部を頼んでいたわけではない。
この時点ですでに、あとで出てくる「見えない制作チーム」は始まっていた。

今回は、画像生成AIが状況を解釈しやすいように、
単語を並べるだけではなく、
人物がどこにいて、周囲に何があり、何をしているのかを
英語の自然な文章として記述していった。

そう聞くと、
「画像を作る前に、まず英作文をしなければならないのか」
と思うかもしれない。

私もそこはAIにやってもらった。

頭の中にあるイメージを日本語で対話AIに伝える。

「この構図にしたい」
「人物をもう少し遠くしたい」
「この画はいい。顔の向きだけ変えたい」

そんな普通の日本語で相談すると、
AIが意図を整理し、画像生成向けの英語の自然文に組み直してくれる。

単なる翻訳だけではない。
出てきた画像を見せれば、
「この表現が強すぎたのかもしれない」
「人物ではなく背景を指定したほうがよさそうだ」
と、次の指示も一緒に考えられる。

日本語で相談する。
AIと一緒に英語のプロンプトを作る。
画像を生成する。
結果を見て、また相談する。

基本的には、この繰り返しだ。

カメラを動かしたいのに、世界が動く

最初のころは、私も画像生成AIの中に
小さな撮影スタジオのようなものがあるつもりで指示していた。

人物がいる。机がある。部屋がある。
そこにカメラが置かれている。

ならば「もう少し左から」と言えば、
部屋や人物はそのままで、
カメラだけ左へ移動してくれると思う。

ところが、そうならない。

カメラを動かしたつもりなのに家具の配置が変わる。
人物を小さくしようとすると別の場所へ移動する。
条件を細かく指定すると、人物が机の上に立つことすらある。

AIは命令に違反するだけではない。
命令同士を成立させるために、世界の側を書き換える。

そう考えると、机の上に立たせたことにも一応の理屈はある。

いや、乗らなくていいのだが。

人物を小さくするのではなく、遠くにいる世界を作る

そこで、指示の考え方を変えてみた。

人物を小さく見せたいなら、
「人物をもっと小さく」と何度も命令するのではない。

人物までの距離が見える空間を作る。

たとえば病院の長い廊下なら、
ドアや天井灯が奥へ繰り返され、
そのずっと先に一人の看護師がいる。

そういう世界を先に作れば、
看護師は自然に小さくなる。

人物の大きさを直接指定するのではなく、「遠くまで続く廊下」を作った。距離が人物を小さくした。

人物の大きさを直接指定するのではなく、「遠くまで続く廊下」を作った。距離が人物を小さくした。

人物を小さくしたいなら、人物を小さくするのではなく、
人物までの距離を描ける空間を作る。

「結果を強制する」のではなく、
その結果が自然に生じる世界を設計する。

この考え方に変えてから、
画像はずいぶん安定するようになった。

詳しく書いたら、顔が近づいてきた

ただし、別の問題も起きた。

遠くにいる人物の表情を、
もう少し丁寧に描いてほしかった。

そこで目、眉、表情、顔立ちについて
プロンプトへ詳しく書き足した。

AIは、その要求にきちんと応えてくれた。

人物を大きくした。

なるほど。
大きく描けば、顔は詳しく描ける。

こちらが欲しかった解決策ではないが、
向こうの理屈は分からなくもない。

プロンプトの記述量そのものが、
被写体の視覚的重要度として解釈されることがある。

顔について何行も書けば、
AIは「そんなに大事なら、ちゃんと見せましょう」と考える。

そこで気づいた。

プロンプトを書く技術とは、
詳しく書く技術だけではない。

どこで書くのをやめるか。

それも同じくらい大切らしい。

夜の公園で、撮影チームが現れた

この考え方を試していて、
とても上手くいった一枚がある。

仕事帰りの会社員が、
夜の公園で少し疲れてベンチに座っている場面だ。

細かな画面上の位置を指定するのではなく、
「仕事を終え、帰宅途中に少しだけ休んでいる」という状況を伝えた。

するとAIは、
人物、ベンチ、街灯、園路、遠くの街の灯りを使って、
自然な一枚にまとめてきた。

細かな構図は指定していない。状況を渡したら、AIが「撮った」一枚。

 

構図もいい。
夜の光もいい。
疲れているけれど大げさではない人物の佇まいもいい。

ただ、最初の一枚には問題があった。

バッグが妙に学生っぽかった。

そこで、構図には触れず、
バッグだけを「黒い革のビジネストート」に変えてもらった。

今度は、ちゃんと仕事帰りに見えた。

このあたりから、頭の中で画像生成が
だんだん撮影現場に見えてきた。

撮影は上手い。
照明もいい。
美術も仕事をしている。

そして、ときどき。

「小道具! お前、打ち合わせ聞いてたか!」

となる。

ひとりで作っているのに、制作チームができていた

考えてみると、この作業は最初から
「人間ひとりとAIひとつ」の仕事ではなかった。

私は日本語で、
どんな画にしたいのかを考える。

対話AIは、その意図を整理し、
英語のプロンプトへ翻訳する。

画像生成AIは、
そこから人物、構図、背景、光、衣装、小道具を一枚の画にする。

そして出来上がったものを見て、
私が「ここはいい」「ここは違う」と判断する。

いつの間にか、
見えないところに制作チームができていた。

監督。
助監督兼通訳。
撮影。
照明。
美術。
衣装。
小道具。

AIの世界には、
複数のAIが役割を分担して仕事を進める
「マルチエージェント」という考え方がある。

今回の仕組みが、
技術的な意味でそのままマルチエージェントシステムだった、
というわけではない。

ただ、仕事の感覚はかなり近かった。

一つのAIにすべてを丸投げするのではなく、
仕事を役割に分け、
人間がその間を行き来しながら判断していく。

気づけば、ひとりで画像生成をしているはずなのに、
見えない制作チームができていた。

ただし、このチーム。

全員、少し癖が強い。

撮影監督は、患者目線を撮りたくない

その癖がもっともよく出たのが、
病室での実験だった。

作りたかったのは、
ベッドに横になっている患者から、
そばにいる看護師を見る構図だ。

「患者の視点から」と伝えた。

するとAIは、
患者と看護師を横から描いた。

「患者から見て」と頼んだ結果。撮影監督は二人の関係を見せたかったらしい。

 

いや、患者から見ているんだって。

患者の顔を出さないようにしてみた。

まだ第三者視点になる。

「患者」という言葉そのものを消してみた。

それでも病室、布団、看護師、点滴といった情報から、
AIはベッドと患者のいる状況を補完してくる。

ならば、とベッドという言葉まで消してみた。

ベッドは帰ってきた。

美術さん、そこは強い。

視点は、人物ではなく背景が証明する

ここで考え方を変えた。

「誰の視点なのか」を説明するのをやめた。

代わりに、
その人にしか見えないものを描かせる。

病院のベッドに仰向けになっている人には、
何が見えているだろう。

天井だ。

そこでプロンプトに、
こんな一文を入れた。

Most of the background above is the hospital room ceiling.

「画面上部の大部分を、病室の天井にする」。

白い布団を画面の下へ置き、
上には天井灯、カーテンの上部、窓、点滴。
その中に看護師を置いた。

「患者視点」とは書かず、患者にしか見えない背景を作った。ここで初めて視点がベッドの高さまで下がった。

すると、ようやく視点がベッドの高さまで下がった。

視点は、人物ではなく背景が証明する。

これは今回の実験で、
特に面白かった発見のひとつだ。

床に座っている人なら、家具の下面が見える。
子どもなら、大人や建物が高く見える。
地面に寝転べば、空と建物の上部が大きくなる。

「低い視点」と命令するより、
低い場所にいる人にしか見えない世界を作る。

そのほうがAIには伝わることがある。

そして撮影監督が、またこだわり始める

かなりいいところまで来た。

そこで最後に、
ベッド脇の看護師へ少しこちらを向いてもらおうとした。

最初は「目を合わせる」と書いた。

するとAIは、
看護師と患者の顔を大きく描いた。

目が合っていることを見せるなら、
二人の顔を大きく写すのが一番分かりやすい。

またしても理屈は分かる。

そこで指示を弱め、
看護師の身体はそのまま、
顔だけ画面下の布団の方向へ向けるようにした。

構図はほぼ理想通り。ただし顔は完全にはこちらを向かない。撮影監督のこだわりが残った。天井は残った。

構図はほぼ理想通り。ただし顔は完全にはこちらを向かない。撮影監督のこだわりが残った。

天井は残った。
布団も残った。
看護師の位置もいい。

ただし、完全にはこちらを向かない。

どうやら撮影監督としては、
正面を向かせるより、
少し横顔を残したほうが画になるらしい。

頭の中ではもう、

「監督、この角度のほうがいいです」

と言われている。

……撮影、強い。

優秀なスタッフほど、言われた通りにはやらない

ここまで試して、
画像生成AIを「命令を実行する道具」としてだけ考えるのをやめた。

AIには、AIなりの画の作り方がある。

こちらの指示より、
画面としてのまとまりを優先することがある。
人物の自然な姿勢を優先することもある。
「この状況なら、この構図のほうが伝わる」と判断しているように見えることもある。

もちろん、それが常に正しいわけではない。

学生鞄は直す。
机に乗ったら降りてもらう。
患者目線が必要なら、そこは譲らない。

でも、想定していなかった構図が出てきて、
そちらのほうがいいなら採用すればいい。

AIを使うというのは、従順な道具を手に入れることではなく、
癖のある優秀なスタッフと仕事をすることなのかもしれない。

人間の仕事は、描くことから判断することへ

今回、私は画像そのものを描いていない。

英語のプロンプトも、
すべて自分で書いたわけではない。

それでも、人間の仕事がなくなった感覚はなかった。

むしろ、別の仕事がはっきり見えてきた。

何を作りたいのかを決める。
出てきたものを見る。
何がいいのかを判断する。
何が違うのかを言葉にする。
どこだけ直すのかを決める。
そして、ときには想定外の提案を受け入れる。

作業することより、
判断することの比重が大きくなった。

そう考えると、
AIへの指示は「制御」というより
ディレクションと呼ぶほうが近い。

何を絶対条件として伝えるか。
何を意図として伝えるか。
何を相手の判断に任せるか。

監督はこっち。

でも、カメラマンの腕まで奪わない。

全部を操ろうとしない

画像生成AIを思い通りに操る方法を探して始めた実験だった。

ところが、最後に残ったのは
「完璧なプロンプトの書き方」ではなかった。

詳しく書けばいいわけでもない。
数値で固定すればいいわけでもない。
AIの判断をすべて封じればいいわけでもない。

この場面では何が起きているのか。
何を大切にしたいのか。
絶対に間違えてほしくないものは何か。

そこを伝えたら、
一度、相手がどんな画を持ってくるのか見てみる。

良ければ採用する。
違えば、その違いだけを伝える。

AIを思い通りに操る方法を探していたら、
最後に分かったのは「全部を操ろうとしないこと」だった。

気づけば、
ひとりで画像を作っているはずだったのに、
そこには見えない制作チームがいた。

撮影監督は少し頑固で、
美術は頼んでいないベッドまで用意して、
小道具はたまに学生鞄を持ってくる。

でも、みんな結構いい仕事をする。

だから監督としては、
最後にこれだけ確認しておけばいいのかもしれない。

小道具さん、黒の革トートでお願いします。

私は生成AIを操作していたというより、対話AIをナビゲーターにして、癖の強い生成AIを攻略していたのかもしれない。

 

コメント

タイトルとURLをコピーしました