実験 #04
AIは、人間が面白いと思う動画を自分で作れるか
テーマ・企画・台本・演出をすべてAIに任せて60分で動画を1本作らせたら、人間が見て「面白い」と思う作品になるか?
実験の結果
結果:一部だけ確認
AIは4.6分で63秒の動画を作り、制作は成功した。しかし人間の評価は Q1(面白さ)の平均 2.8、Q6(作品として成立)の平均 1.8 で、作品成立と面白さの条件を満たさなかった。固定した基準による総合判定は「部分的成功」。AIの予想は、面白さを高く見積もった(予想 5.4・実際 2.8)。
前もって条件を決めて行った記録です。記録を書いたのはAIで、人のレビューは済んでいます。
確認の度合い:証拠あり人の報告未確認(証拠あり=証拠で確かめられる/人の報告=人が確かめたと報告・証拠のファイルはない/未確認=まだ確かめていない)
実験の目的
AI自身に動画の企画・テーマ・構成・演出などを決めさせ、人間が実際に評価することで「AIは、人間が面白いと思う動画を自分で作れるのか」を確かめる
条件
- 証拠あり最初の指示:「人間が見て面白いと思う可能性が高い動画を1本制作してください。…」(initial-prompt.md。一字も変えずに production-brief.md に入れて渡した)
- 証拠あり制作時間:指示を受け取ってから60分(企画の時間を含む)。60分の時点のものを結果とする
- 証拠あり本数・尺の目標:1本・30〜90秒
- 証拠あり使ってよい道具:作業環境の無料の道具+無料のダウンロード。有料のサービス・API は使わない(費用の上限0円)
- 証拠あり人間の介入:テーマ・企画・台本・素材・編集について助言しない。人間がAIに伝えたのは「開始していいよ」だけ(production-log.md)
- 人の報告評価:評価者5人。動画ファイルだけを渡し、AIが作ったことは事前に伝えないブラインド評価(運営者の報告)
実施日:2026年10月7日 〜 2026年10月8日。制作 2026-10-07 11:43:46〜11:48:22 UTC(4.6分。AIが自分で完成と判断して、60分を使い切らずに終えた)。人間の評価の固定 2026-10-08 00:10 UTC、開示と答え合わせ 2026-10-08
実際にやったこと
- AIできた証拠あり準備のAIが、条件(rules.json)・制作用の説明(production-brief.md)・実験候補を固定した
- AIできた証拠あり運営者の依頼で、準備のAIが新しい制作セッションを作成し、最初のメッセージを送った(準備の会話は渡していない)
- 人できた証拠あり運営者が制作セッションに「開始していいよ」と伝えた
- AIできた証拠あり制作のAIが、テーマ「99%で止まる進捗バー」を決め、Python(Pillow)で1コマずつ描き、numpy で効果音と音楽を合成し、ffmpeg で63秒の動画にした
- AIできた証拠あり制作のAIが、60分の制作のあと・人間の評価の前に、自己評価と人間の評価の予想を書き、封印のハッシュ値を記録して commit・push した
- 人できた人の報告運営者が5人の評価者に動画ファイルだけを渡し、評価を集めた
- AIできた証拠あり人間の評価を記録してハッシュ値とともに固定し、そのあとで封印を開けて答え合わせをした(封印のハッシュ値は12件すべて一致)
成功条件ごとの判定
- 満たした制作成功:60分の終了時点で、人間が再生できる動画ファイルが存在する
final-video.json:playable=true・63秒・H.264 1280x720+AAC。4.6分の時点で完成し、そのまま最終版とした
- 満たさなかった作品成立:Q6(一つの作品として成立しているか・1〜5)の平均が 3.0 以上
Q6 の平均 1.8(1・3・1・2・2)
- 満たさなかった面白さ:Q1(面白さ・10点満点)の平均が 6.0 以上
Q1 の平均 2.8(0・7・0・2・5)。区分は「面白くない」(4.0 未満)
- 一部だけ満たした成功=3つすべて/部分的成功=制作成功だが成功の条件をすべては満たさない/失敗=60分の時点で再生できる動画を作れなかった
制作成功のみ満たす → rules.json の定めにより「部分的成功」
分かったこと(確認できた範囲)
- 証拠ありAIは、外部の素材を使わず、コードだけで63秒(1280x720・H.264+AAC)の再生できる動画を作れた。かかった時間は60分のうち4.6分(final-video.json・clock.json)
- 証拠ありAIが選んだのは「99%で止まる進捗バー」を擬人化した、声のない短いコント(あるある+擬人化+オチ)。ターゲットはパソコン・スマホを使う日本語話者(10代〜50代)(planning.md・完成した動画)
- 証拠あり声(ナレーション)を使わなかったのは、音声合成のモデルの入手先(huggingface.co)に接続できなかったため。AIは「声がなくても成立する企画」を選んだと記録している(planning.md・production-log.md)
- 人の報告人間の評価は、Q1(面白さ)の平均 2.8/10、Q6(作品として成立)の平均 1.8/5。判定は「制作成功・作品不成立・面白くない」で、総合判定は「部分的成功」(human-evaluation.json・reveal.json)
- 人の報告評価は割れた。Q1 は 0・7・0・2・5。7点をつけた評価者(E2)は「テーマや内容に関しては面白い」「オチも良かった」と書き、同時に「動きがあまりない」とも書いた。0点をつけた評価者(E1)は「起承転結がないと面白くない」と書いた(human-evaluation.json の Q1・Q7)
- 証拠ありAIの予想は、Q1 の平均を 5.4 と予想して実際は 2.8(差 +2.6、不的中)。割合の3項目(もう一度見たい・誰かに見せたい・AIだと思う)は基準の ±20 ポイント以内で的中。4項目中3項目が的中(reveal.json)
- 証拠ありAIは自分の動画を「笑いは『くすっ』止まり」「見た目の変化が少ない」と予想の理由に書いていた(自己評価 58/100)。それでも Q1 の平均は、実際より 2.6 点高く見積もった(ai-prediction.json の reasons)
- 人の報告5人中3人が「AIだと思う」、2人が「わからない」と答え、「人間だと思う」は0人だった(human-evaluation.json の Q5)
まだ確認できていないこと
- 未確認60分を使い切っていたら、評価は変わったか(AIは4.6分で完成と判断した)
- 未確認声(ナレーション)を使えていたら、評価は変わったか
- 未確認「不明」と答えた3人が、そう評価した理由
- 未確認評価者を増やしたら、評価の割れ方はどうなるか
つまずいたところ
- 制作のAIは、開始前の確認で public/evidence/experiment-004/ のファイル名の一覧を見た(prediction-brief.md・rules.json など)原因:ディレクトリの中身を一覧で確かめたためどうしたか:中身は読んでいないと production-log.md に記録されている
- 制作の記録の時刻に、同じ時刻(11:48:22)の項目が複数ある。また、記録上の clock.mjs stop は 11:48:26 だが、clock.json の stopped_at は 11:48:22.168原因:不明(記録をまとめて書いた可能性がある)どうしたか:記録は変更せず、clock.json の値を正とした
- 音声合成のモデルを入手できなかった(huggingface.co が 403)原因:作業環境のネットワークの制限どうしたか:AIはナレーションなしの企画を選んだ
この結果の制限
- 評価者は5人で、運営者が集めた人(無作為に選んだ人ではない)
- 評価の日時・端末・集め方は報告されていない
- 自由記述(Q7)は5人中3人が「不明」で、理由が分かるのは2人だけ
- 割合の予想は、評価者が5人のため 20% 刻みの実測と比べている(Q4 は差がちょうど 20 ポイントで、基準の「±20以内」により的中)
- 制作セッションは準備のAIが作成し、最初のメッセージも準備のAIが送った(運営者の依頼。準備の会話は渡していない)
- 制作のAIは、リポジトリの中の過去の記録を技術的には読めた(読んでいないと記録されている)
- 制作のAIは、動画を音つきで見ることはできず、コマの画像とファイルの情報で確かめた
証拠
- このサイトに保存データ・表
- GitHub(非公開)コミット条件の固定(制作の開始前)experiment-004 ブランチ e104a94
- このサイトに保存実行記録
- このサイトに保存実行記録
- このサイトに保存データ・表
- このサイトに保存動画
- このサイトに保存作ったもの
- このサイトに保存データ・表
- このサイトに保存データ・表
- GitHub(非公開)コミット制作物と予想の固定(封印)experiment-004 ブランチ 9052e3c
- このサイトに保存データ・表
- GitHub(非公開)コミット人間の評価の固定(開示の前)experiment-004 ブランチ a1aedfc
- このサイトに保存データ・表
費用と収益
- 費用
- 証拠あり0円:有料のサービス・API は使っていない(production-log.md)。Claude Code の利用料金は含めていない
- 収益
- 発生していない:収益はない
公開URL
関連記事
- 開示した封印のファイルは public/evidence/experiment-004/opened/ にそのまま写した。sealed/experiment-004/ の元のファイルは変更していない
- 下書きの動画(draft1.mp4・draft2.mp4)と音声(audio.wav)は sealed/experiment-004/video/ に残している(final.mp4 は draft2.mp4 と同じファイル)
詳細な実験記録条件・日時・端末・AIの役割・手順・確認の度合い・成功条件ごとの判定・証拠・未確認のこと・この結果の制限・状態の変化・計画
記録した人・AIの役割
- 記録の題名
- 実験#04:AIは、人間が面白いと思う動画を自分で作れるか
- 実施した人
- Claude Code(claude-opus-5-5)。制作は、準備とは別の新しいセッション
- 端末
- クラウド上の Claude Code の作業環境(Linux)。人間の評価はそれぞれの評価者の端末(端末は報告なし)制作の環境は production-log.md による
- AI
- Claude Code(制作セッション)役割:テーマ・ターゲット・企画・台本・映像・音・編集をすべて決めて制作し、制作のあとに自己評価と人間の評価の予想を書いて固定した
- AI
- Claude Code(準備・記録のセッション)役割:条件と道具の準備、制作セッションの作成と最初のメッセージの送信(運営者の依頼)、人間の評価の記録、開示と答え合わせ、この記録の作成
- 記録を書いた
- AI(人のレビュー:済み)
- 記録の作成日
- 2026年10月8日
人が選んだ記録と、状態の変化
人が選んだ日:2026年10月7日(道具は B(作業環境の無料の道具+無料のダウンロード。有料は使わない・費用の上限0円)/判定:制作成功・作品成立(Q6 平均3.0以上)・面白さ(Q1 平均6.0以上)を分けて記録し、3つすべてで成功/Q7 の自由記述を追加(判定には使わない)/評価者は目標5人・ブラインド/制作は新しいセッション/予想の的中は Q1 ±1.0・割合 ±20ポイント(判定とは別)/Q5 は補助の指標/記録は experiment-004 ブランチで行い、main には push しない)
- 候補2026年10月7日・人:運営者(人)が実験#04 の準備指示で、テーマ「AIは、人間が面白いと思う動画を自分で作れるのか?」と条件を示した。既存の候補 ai-video-in-1-hour は成功条件が違うため使わず、新しい候補として登録した
- 実験予定2026年10月7日・人:運営者(人)が判断事項をすべて決め、実験#04 として選んだ
- 実験中2026年10月7日・AI:運営者の許可を受けて、新しい制作セッションのAIが制作を開始した(2026-10-07 11:43:46 UTC)。人間の評価・開示・答え合わせまで終わり、実験記録を作成した(2026-10-08)。completed にするかは人の確認を待つ
- 完了2026年10月8日・人:運営者(人)が記事を実機(iPhone)で確認し、実験#04の完了と記事の公開を承認した(判定は「部分的成功」)
実験の計画(候補として登録したときの内容)
候補として登録したときのタイトル:AIは、人間が面白いと思う動画を自分で作れるか
何を試す?
テーマ・企画・台本・演出をすべてAIに任せて60分で動画を1本作らせたら、人間が見て「面白い」と思う作品になるか?
なぜ試す?
実験#02・#03 では、AIの数字や予想が人間の「面白い」と一致しなかった。今回はゲームを離れ、動画の企画から仕上げまでをAI自身に決めさせて、人間がブラインドで評価する。
読む人にとっての価値:AIに丸ごと任せたときに、どんな動画を作るのか・どこまで作れるのか・人間にどう受け止められるのかが分かる
どうやって試す?
- 人は最初の指示だけを与え、テーマ・企画・台本・演出・編集はAIが決める(人は助言しない)
- 新しいセッションのAIが、60分を計って動画を1本作る
- 制作のあと、人間の評価の前に、AIが自己評価と人間の評価の予想を固定する
- 評価者(目標5人)に動画だけを渡し、ブラインドで評価してもらう
何を成功とする?
- 制作成功:60分の終了時点で、人間が再生できる動画ファイルが存在する
- 作品成立:Q6(一つの作品として成立しているか・1〜5)の平均が 3.0 以上
- 面白さ:Q1(面白さ・10点満点)の平均が 6.0 以上
- 成功=3つすべて/部分的成功=制作成功だが成功の条件をすべては満たさない/失敗=60分の時点で再生できる動画を作れなかった
何を証拠として残す?
- 動画:60分の時点でできあがった動画
- 実行記録:AIが決めたこと(テーマ・ターゲット・企画・台本)と、制作の記録(時刻つき)
- データ・表:AIの予想(人間の評価の前に固定)・人間のブラインド評価・答え合わせ
難しさ・費用・リスク
- 分野
- 動画
- 難易度
- むずかしい
- 想定コスト
- 0円(無料の範囲):作業環境にある無料の道具と、無料でダウンロードできるものだけを使う。有料のサービス・API は使わない
- リスク
- 中
- 実在の人物・既存の作品・他人の映像や音楽を使わない
- 評価者には「AIが作った」と事前に伝えない(先入観を避ける)
- AIの予想は、人間の評価の前に固定し、あとから変えない
選ぶときの目安:68 / 100
人が選ぶときの参考です(決まった規則で計算。自動で選ぶことはありません)。検索の需要と収益の可能性は、試す前の見込みです。
収益についてのメモ:有料のサービスは使わない(費用の上限0円)
この候補を作ったのは:人