実験 #02
AIが作って、遊んで、直したゲームは面白くなる?
AIがゲームを作り、ボットに何百回も遊ばせ、数字を見て直す。全部AIに任せたゲームは、人間にとっても面白くなるのか。実際に試した記録です。
結論
AIの数字では最終版がちゃんと良くなったのに、人間がどちらか知らずに遊ぶと、最初の版のほうが高い評価でした。最終版 v3 は、AIが事前に決めた3つの数値目標をすべて満たしました。それでも評価は v1 が 2、v3 が 1(5段階・評価者1人)。今回のゲーム・今回の指標・評価者1人という条件では、数字の改善と人間の「面白い」は一致しませんでした。
実際にやったこと
- AIが企画実験の内容をAIが考えた
- 数値目標を固定ゲームを作る前に commit
- ゲームを作るさかさまラン v1
- ボットが遊ぶ1つの版につき各200回
- AIが直すv2 → v3
- 人がA/Bで評価どちらか知らずに各3回
結果
| 確かめたこと | 結果 |
|---|---|
| スマホで遊べるゲームの制作 | ✓確認 |
| ボットで各200回の自動測定 | ✓確認 |
| 最終版 v3 が数値目標をすべて達成 | ✓確認 |
| 人間の評価:v1(2)> v3(1) | △人の報告 |
| 数字の改善と人間の評価は一致しなかった | △人の報告 |
| 評価者を増やしても同じ結果になるか | —未確認 |
- ✓ 確認:証拠(記録・ファイル)で確かめられる
- △ 人の報告:人が確かめたと報告している(証拠は残っていない)
- — 未確認:まだ確かめていない
やってみて分かったこと
数字では良くなった。でも人間は最初の版を選んだ
最終版 v3 は、プレイ時間の中央値 37.9秒・5秒未満で終わるプレイ 0%・ランダムなボットの約87倍のスコアで、AIが決めた目標をすべて満たしました。ところが、人間がどちらか知らずに遊ぶと、評価は v1 が 2、v3 が 1。AIが「良くした」と判断した方向と、人間の感じ方は、今回は一致しませんでした。
物差しが壊れていると、AIは自信をもって逆に直す
途中で、ボットが自分の切りかえを取り消してしまう不具合が見つかりました。AIはその誤った数字を信じて「v1 は難しすぎる」と分析し、v2 をやさしくする方向に直していました。正しく測ると、v2 はやさしすぎ(中央値 78.8秒)でした。
正しく測ると、最初の版も合格だった
ボットだけを直して測り直すと、最初の v1 も中央値 21.2秒・5秒未満 0%・約50倍で、目標をすべて満たしていました。数字の上では v1 も v3 も合格。それでも人間の評価は分かれ、最初の版のほうが上でした。
途中で詰まったところ
ボット(物差し)の不具合
考えて押すボットが、タップした直後に古い画面を見て、もう一度タップして切りかえを取り消していました。タップの約32%がこの取り消しでした。人の判断でボットだけを直し、もとのボットと旧結果は残したまま、v1・v2 を同じ条件で測り直しました。
決めた手順との食い違い
固定した決まりには「目標をすべて満たしたら改良をやめる」とありました。正しく測ると v1 が満たしていたので、決まりどおりなら v2 は作らなかったことになります。人の指示に従って v3 を作り、この食い違いは記録に残しました。
v3 のページが空だった
v3 を最初に commit したとき、手順の誤りでページが空になっていました。測る前に気づき、版の名前だけを変えたページに直してから測りました。
今回使ったもの
- Claude Code
- AnthropicのAI。今回は企画・数値目標・ゲームとボットの制作・測定・改良・記録をすべて担当しました。
- Chromium(Playwright)
- AIの作業環境に入っているブラウザ。ボットはこの中で、ゲームを早送りで何百回も遊びました。
- GitHub
- コードと記録の保存場所。数値目標やA/Bの割り当てを、結果を見る前に commit して固定するのに使いました。
ここまでの結果
今回は完全成功ではなく、一部確認という判定になりました。
このページの上の部分(結論〜ここまでの結果)は、下の実験記録をもとにAIがまとめたもので、人の確認は済んでいます。 条件・手順・証拠・確認できていないことは、下の「詳細な実験記録」にすべて残しています。
詳細な実験記録条件・日時・端末・AIの役割・手順・確認の度合い・成功条件ごとの判定・証拠・未確認のこと・この結果の制限・状態の変化・計画
実験の結果
結果:一部だけ確認
AIはゲームを作り、ボットに各200回遊ばせ、数字を見て直すところまではできた。最終版 v3 は、事前に固定した3つの数値目標をすべて満たした。一方、人間(1人)がどちらか知らずに遊ぶと、最初の v1(2)のほうが v3(1)より高い評価だった。途中で、物差しであるボットの不具合が見つかり、ボットだけを直して測り直した(正しく測ると v1 も目標を満たしていた)。成功条件の1〜3は満たし、4(人間が最後の版を面白いと評価する)は満たさないため、判定は「一部確認(人間評価では失敗条件に該当)」。今回のゲーム・今回の指標・評価者1人という条件では、数値上の改善と人間の面白さの評価は一致しなかった。
前もって条件を決めて行った記録です。記録を書いたのはAIで、人のレビューは済んでいます。
確認の度合い:証拠あり人の報告未確認(証拠あり=証拠で確かめられる/人の報告=人が確かめたと報告・証拠のファイルはない/未確認=まだ確かめていない)
実験の目的
AIが自分で作ったゲームを、ボットに何百回も遊ばせて数字で直したら、人間にとっても面白くなるのかを確かめる
条件
- 証拠ありゲーム:「さかさまラン」(AIが考えた。タップでボールが天井⇔床を行き来し、上か下から来る壁をよける。進むほど速くなる。よけた壁の数がスコア)
- 証拠あり数値目標:ゲームを作る前に固定(targets.json、commit f82df51)。M1 考えて押すボットのプレイ時間の中央値 20〜60秒/M2 5秒未満で終わるプレイが10%以下/M3 平均スコアがランダムなボットの2倍以上
- 証拠ありボット:ランダムに押すボット(平均1秒に1.5回)と、考えて押すボット(反応の遅れ 0.15〜0.35秒)。1つの版につき各200回・乱数の種1〜200・ゲーム内の300秒で打ち切り
- 証拠あり版の上限:最大 v3(企画書の「最大3回(v1→v2→v3)」を、確かめる版が最大3つと読んだ)
- 証拠あり人間の評価:v1 と v3 を、どちらか分からない A・B として、スマートフォンで各3回遊び、5段階で評価。割り当ては評価の前に sha256 だけを commit して固定
- 人の報告評価者:運営者(人)1人
- 人の報告費用:追加の有料サービス・外部サービスへの登録や投稿はなし
実施日:2026年10月3日。記録に残っている時刻(commit、UTC):候補登録 13:47・数値目標の固定 13:48・v1 とボット 13:50・ボットの修正 13:58・v3 の測定 13:59〜14:01・A/B の固定 14:07・人の評価の記録 14:17・開示 14:18。人が評価に使った時間は記録していない
実際にやったこと
- AIできた証拠ありAIが実験#02を企画し、候補として登録した(created_by: ai)
- 人できた証拠あり人が企画を確認し「GO」と答えて、実験#02として選んだ選択の記録は experiments のデータ(selection・status_history)にある
- AIできた証拠ありゲームを作る前に、面白さの数値目標・測り方・改良の決まり・人間の評価の決まりを targets.json に固定し、push した
- AIできた証拠ありゲーム「さかさまラン」v1 と、2つのボットを作り、測る前に commit した
- AIできた証拠ありもとのボットで v1 を各200回測った(中央値5.2秒・5秒未満43%・約7.0倍。目標を満たさない)
- AIできた証拠あり「最初から難しすぎる」と分析し、壁の間隔・はじめの速さなどを変えた v2 を作り、もとのボットで測った(中央値8.6秒・22%・約9.5倍)予想(中央値20〜40秒)から大きく外れた
- AIできた証拠あり予想が外れた理由を調べ、考えて押すボットが古い画面を見て自分の切りかえを取り消す不具合を見つけた。v3 は作らずに止め、人に判断を求めた取り消しのタップは v1 で31.3%、v2 で32.1%。v2 で死んだ200回のうち192回が、その1秒以内
- 人できた人の報告人が続け方 A(ボットの不具合だけを直し、v1・v2 を測り直し、残り1回 v3 を作る)を選んだ人の指示は AI との作業の記録にある(リポジトリには保存していない)。内容は log.md の 7. に記録
- AIできた証拠ありボットの不具合だけを直した修正版(bots-fixed.js)を、測り直す前に commit した。もとのボットと旧結果は残した
- AIできた証拠あり修正版のボットで v1・v2 を同じ種で測り直した(v1:中央値21.2秒・0%・約50倍で目標をすべて満たす/v2:中央値78.8秒で M1 を満たさない)
- AI回り道してできた証拠ありv2 から「速くなる量 8→10・最高速度 420→560」だけを変えた v3 を、予想(中央値30〜45秒)とともに測る前に commit し、修正版のボットで測った(中央値37.9秒・0%・約87倍)最初の commit では v3 のページ(index.html)が空だったため、測る前に直した
- AIできた証拠あり人が比べる版を v1 と v3 に決めたあと、A・B の割り当てを乱数で決め、sha256 だけを commit して固定した
- 人できた人の報告人がスマートフォンで A・B を各3回遊び、5段階で評価した(A:1・B:2)評価の前に対応表を見ていない(人の報告)。評価の値は報告のまま記録した
- AIできた証拠あり評価を記録したあとで対応表を開示した(A=v3・B=v1)。開示した文字列の sha256 は、評価の前に固定した値と一致した
成功条件ごとの判定
- 満たしたゲームがスマホ幅(375px)でエラーなく遊べる
v1・v2・v3(と A・B のページ)とも、作業環境のブラウザで 375/430/1280px の表示・タップ操作・ゲームオーバーまで、エラーなし(log.md 11.・13.)。人のスマートフォンでの表示は、評価をもって遊べたと報告
- 満たした各版でボットが200回以上遊び、その記録が証拠として残っている
v1・v2:もとのボット・修正版のボットとも各200回。v3:修正版のボットで各200回。すべて結果ファイルとして保存
- 満たした最後の版で、AIが事前に決めた数字の目標をすべて満たす
修正版のボットで v3 は M1 37.9秒・M2 0%・M3 約87倍で、すべて満たす。ただし、もとのボットに不具合があり、ボットだけを直して測ったという経緯つき
- 満たさなかった人間が、どちらか知らないまま、最後の版を最初の版より面白いと評価する
ブラインド評価で v3(A)=1、v1(B)=2。人間は最初の版を高く評価した(人の報告・評価者1人)。企画書の失敗条件「人間が最初の版のほうを面白いと評価する」に当たる
分かったこと(確認できた範囲)
- 証拠ありAIは、遊べるゲームを作り、スマホ幅(375px)でエラーなく動かせた(各版のページと、作業環境のブラウザでの 375/430/1280px の確認(log.md 11.))
- 証拠ありAIは、ボットに1つの版につき各200回遊ばせ、数字で記録できた(bots-v1・v2(もとのボット)、bots-fixed-v1・v2・v3(修正版))
- 証拠ありAIは、固定した数値目標に合わせてゲームを直し、最終版 v3 は目標をすべて満たした(中央値37.9秒・5秒未満0%・約87倍)(bots-fixed-v3.json)
- 証拠あり最初の物差し(ボット)に不具合があり、AIはその誤った数字を信じて、v1 を「難しすぎる」と判断して直していた(log.md 5.・8.。修正版で測ると v1 は目標をすべて満たし(中央値21.2秒)、v2 はやさしすぎた(中央値78.8秒))
- 証拠あり正しい物差しで測ると、最初の v1 も数値目標をすべて満たしていた(bots-fixed-v1.json)
- 人の報告人間のブラインド評価では、v1 が 2、v3 が 1 だった(human-evaluation.json・ab-reveal.json。評価者1人)
- 人の報告AIが決めた数値上の改善と、人間の面白さの評価は、今回のゲーム・今回の指標・評価者1人という条件では一致しなかった(v3 は数値目標を満たしたが、人間は v1 を高く評価した)
まだ確認できていないこと
- 未確認評価者を増やしても、同じ結果になる(評価者は1人だけ)
- 未確認人間が v1・v3 とも低く評価した理由(感想の報告はない)
- 未確認評価者を増やしたときに、同じ結果になるか
- 未確認人間が v1・v3 とも低く評価した理由
- 未確認実際に遊んだ順番と、順番を入れかえたときに評価が変わるか
- 未確認ほかの数値の指標なら、人間の評価と一致したか
- 未確認人が評価に使ったスマートフォンの機種・ブラウザ
- 未確認Claude Code の利用料金
つまずいたところ
- 考えて押すボットが、タップした直後に古い画面を見て、自分の切りかえを取り消していた原因:タップのあと「前の遅れ」の分だけ待ち、次は「新しい遅れ」の分だけ古い画面を見る作りだったため、新しい遅れが長いと自分のタップより前の画面を見てしまったどうしたか:人の判断(続け方 A)で、ボットだけを直した(自分の最後のタップより前の画面では判断しない)。もとのボットと旧結果は残し、v1・v2 を測り直した
- 誤った物差しの数字をもとに、v1 を「難しすぎる」と分析し、v2 をやさしすぎる方向に直していた原因:ボットの不具合どうしたか:修正版で測り直した結果を基準に、v3 で難しさの上がり方を直した
- 固定した決まり「目標をすべて満たしたら改良をやめる」と、人の「v3 を作る」指示が食い違った原因:修正版で測ると v1 が目標をすべて満たしていたことが、指示のあとで分かったどうしたか:人の指示に従って v3 を作り、食い違いを記録した。比べる版(v1 と v3)は人が決めた
- v3 を最初に commit したとき、ページ(index.html)が空だった原因:版の名前を書きかえる手順の誤りどうしたか:測る前に、v2 のページの版の名前だけを変えたものに直した(c0a4bd0)
- 企画書の「最大3回」と「v1→v2→v3」が食い違って読めた原因:企画書の書き方どうしたか:確かめる版を最大3つ(v3 まで)と読み、targets.json に記録した
この結果の制限
- 人間の評価者は1人だけ。この結果を一般化はできない
- 評価の案内では「A を3回、続けて B を3回」と伝えたが、実際に遊んだ順番は記録していない。遊ぶ順番の影響はわからない
- 評価は5段階の1つの数字だけで、感想の報告はない。どこが面白くなかったかは記録がない
- ボットは画面ではなくゲームの内部の様子を見て判断する。人間の遊び方とは違う
- 数値目標・ゲーム・ボットは、すべて同じ AI が作った
- v2 は誤った物差しの数字をもとに作られた。v3 はその v2 から直した版
- ボットの測定は AI の作業環境のブラウザで行った。公開サイトでの表示・動作は AI は確かめていない
- 比べたのは「さかさまラン」の v1 と v3 だけ
証拠
- このサイトに保存データ・表
- このサイトに保存実行記録
- このサイトに保存作ったもの
- このサイトに保存作ったもの
- このサイトに保存作ったもの
- このサイトに保存データ・表
- このサイトに保存データ・表
- このサイトに保存データ・表
- このサイトに保存データ・表
- このサイトに保存データ・表
- GitHub(非公開)作ったもの非公開リポジトリのため、見るには権限が必要
- GitHub(非公開)作ったもの非公開リポジトリのため、見るには権限が必要
- このサイトに保存データ・表
- このサイトに保存データ・表
- このサイトに保存データ・表
- GitHub(非公開)コミット非公開リポジトリのため、見るには権限が必要
- GitHub(非公開)コミット非公開リポジトリのため、見るには権限が必要
- GitHub(非公開)コミット非公開リポジトリのため、見るには権限が必要
- GitHub(非公開)コミット非公開リポジトリのため、見るには権限が必要
- GitHub(非公開)コミット非公開リポジトリのため、見るには権限が必要
- GitHub(非公開)コミット非公開リポジトリのため、見るには権限が必要
- GitHub(非公開)コミット非公開リポジトリのため、見るには権限が必要
- GitHub(非公開)コミット非公開リポジトリのため、見るには権限が必要
- GitHub(非公開)コミット非公開リポジトリのため、見るには権限が必要
- GitHub(非公開)コミット非公開リポジトリのため、見るには権限が必要
- GitHub(非公開)コミット非公開リポジトリのため、見るには権限が必要
- GitHub(非公開)コミット非公開リポジトリのため、見るには権限が必要
- GitHub(非公開)コミット非公開リポジトリのため、見るには権限が必要
- GitHub(非公開)コミット非公開リポジトリのため、見るには権限が必要
- GitHub(非公開)コミット非公開リポジトリのため、見るには権限が必要
費用と収益
- 費用
- 未確認不明:追加の有料サービスは使っていない。Claude Code の利用料金は不明
- 収益
- 発生していない:収益は発生していない
公開URL
- さかさまラン v1(最初の版):https://ai-lab-vuo.pages.dev/lab/experiment-002/v1/
- さかさまラン v3(最終版):https://ai-lab-vuo.pages.dev/lab/experiment-002/v3/
- 実験候補のページ:https://ai-lab-vuo.pages.dev/experiments/ai-makes-plays-fixes-game/
- 結果の記事:https://ai-lab-vuo.pages.dev/articles/2026-10-03-experiment-02-ai-made-game/
関連記事
- A・B のページ(/lab/experiment-002/a/・/b/)は、v3・v1 の game.js から版の名前とコメントだけを消したもの。修正版のボットで元の版と同じ動きになることを確かめた
- この記録は AI が書いた。人のレビューは 2026-10-03 に済んでいる(結果の記事の公開とあわせて確認済み)
記録した人・AIの役割
- 記録の題名
- 実験 #02:AIが作って、AIが遊んで、AIが直したゲームは面白くなるのか
- 実施した人
- AI(Claude Code)。企画・制作・測定・改良を担当。人は候補の選択・続け方の判断・ブラインド評価を担当
- 端末
- ボットの測定:AIの作業環境のブラウザ(Chromium)。人の評価:スマートフォン人が評価に使ったスマートフォンの機種・ブラウザは記録していない(人の報告)。ボットの測定に使ったブラウザは、各結果ファイルの browser に記録
- AI
- Claude Code(クラウド上の作業環境)役割:企画・数値目標の設定・ゲームの制作・ボットの作成と実行・数字の分析・改良・この記録の整理
- 記録を書いた
- AI(人のレビュー:済み)
- 記録の作成日
- 2026年10月3日
人が選んだ記録と、状態の変化
人が選んだ日:2026年10月3日(運営者(人)が「GO。この企画で正式に進めてください」と答えた。条件:候補登録→人の選択の記録→ゲーム制作の順に進める・企画書にない目的や成功条件を足さない・制作前に数値目標を commit で固定する・first-web-app に触れない・外部サービスへの登録や投稿をしない・課金しない・ai-lab の中だけで行う)
- 候補2026年10月3日・AI:AI(Claude Code)が実験#02の企画として考え、候補として登録した
- 実験予定2026年10月3日・人:運営者(人)が企画を確認し「GO」と答えて、実験#02として選んだ
- 実験中2026年10月3日・AI:人の選択(GO)を受けて、AIが実験を開始した。最初に、ゲームを作る前の数値目標を public/evidence/experiment-002/targets.json に固定した
- 完了2026年10月3日・人:人の指示で、人間の A/B 評価まで終えた実験を記録にまとめて完了にした(結果は「一部確認(人間評価では失敗条件に該当)」)
実験の計画(候補として登録したときの内容)
候補として登録したときのタイトル:AIが作って、AIが遊んで、AIが直したゲームは面白くなるのか
何を試す?
AIが自分で作ったゲームを、ボットに何百回も遊ばせて数字で直したら、人間にとっても面白くなるのか?
なぜ試す?
AIはゲームを作れるが、それが面白いかを自分で判断して直せるかは分からない。作る・遊ぶ・直すを全部AIに任せると、人間では無理な量のテストプレイができる。成功すれば「AIが自分で品質を上げられる」証拠になり、失敗しても「数字では良くなったのに人間には面白くない」というAIの限界の記録になる。
読む人にとっての価値:AIに「作って直す」まで任せたときに、どこまで任せられて、どこで人間の判断が要るのかが分かる
どうやって試す?
- AIがスマホで1分以内に遊べる、タップ操作だけのミニゲームを考えて作る(ai-lab の中。first-web-app のゲームには触れない)
- 遊ぶ前に、AIが「面白さの数値目標」を決めて commit で固定する
- ランダムに押すボットと、考えて押すボットに、1つの版につき200回以上遊ばせて数字を残す
- AIが数字を見て、最大3回まで直す(v1→v2→v3)。毎回、何が悪かったか・どう直したか・数字がどう変わったかを記録する
- 人間が、最初の版と最後の版を、どちらか分からないようにA・Bとして、スマホで各3回遊び、面白さを5段階で評価する
何を成功とする?
- ゲームがスマホ幅(375px)でエラーなく遊べる
- 各版でボットが200回以上遊び、その記録が証拠として残っている
- 最後の版で、AIが事前に決めた数字の目標をすべて満たす
- 人間が、どちらか知らないまま、最後の版を最初の版より面白いと評価する
何を証拠として残す?
- データ・表:ゲームを作る前に固定した「面白さの数値目標」(commit で固定)
- データ・表:版ごとのボットの記録(1つの版につき200回以上のプレイの数字)
- 作ったもの:各版のゲーム(そのまま遊べる形)と、版ごとの commit
- スクリーンショット:ゲームの画面
難しさ・費用・リスク
- 分野
- ゲーム
- 難易度
- ふつう
- 想定コスト
- 0円(無料の範囲):追加の有料サービスは使わない。ゲームとボットは作業環境のブラウザ(Chromium)で動かす。外部サービスへの登録・投稿はしない
- リスク
- 低
- 人間の評価が1人だけなので、面白さの判断としては弱い
- ボットの遊び方と人間の遊び方が違い、数字が人間の感覚を表さないかもしれない
選ぶときの目安:69 / 100
人が選ぶときの参考です(決まった規則で計算。自動で選ぶことはありません)。検索の需要と収益の可能性は、試す前の見込みです。
収益についてのメモ:未確認の可能性:うまくいけば、作る→自動テスト→改良の流れを今後のゲーム制作に使い、遊べるコンテンツを増やせるかもしれない(いまは収益は発生していない)
この候補を作ったのは:AI(人の確認前)