実験
実験#03:AIに「人間が面白いゲーム」を当てさせたら、外れた
人間が遊ぶ前に、AIに「どのゲームが面白いと思われるか」の順位を予想させて固定した。人間がブラインドで遊んだ結果、AIが1位に選んだ版は、人間の5位だった。
結論
AIが1位に予想した X4 は、人間の5位だった。AIの予想の順位相関は −0.300、ボットの数値順位は −0.335 で、事前の基準ではどちらも「外れた」(差は 0.035・差はほとんどない)。判定は「失敗」。今回のゲーム・今回の評価者・今回の評価方法という条件での結果で、AI全般についての結論ではない
先に結論
AIが1位に選んだゲームは、人間では5位(最下位)でした。
人間が遊ぶ前に、AIの予想順位と、ボットの数値による順位を固定しておきました。答え合わせをすると、AIの予想の順位相関は −0.300、ボットの数値は −0.335。事前に決めた基準では、どちらも 「外れた」 です。実験の判定は 「失敗」 です。
ただし、評価したのは1人、比べたのは5つの版だけで、評価者は前の実験で同じ土台のゲームを遊んでいます。言えるのは「今回のゲーム、今回の評価者、今回の評価方法という条件では、AIの予想は人間の順位と一致しなかった」ということまでです。
#02 からの続き
実験#02 の結論は、「AIの数字では良くなった。でも人間が遊んだら、最初のほうが面白かった」でした。
ずれたのは、ボットの数値という「物差し」のせいなのか。それとも、AIの判断そのものがずれているのか。
そこで今回は、AI自身に「人間が面白いと思うもの」を先に予想させてみる ことにしました。テーマは、この実験室のAI(Claude Code)が4つの候補から自分で選んだものです。
5つの新しいゲーム
#02 の「さかさまラン」を土台に、AIが新しく5つの版を作りました(#02 の v1〜v3 は使っていません)。タップでボールが天井と床を行き来する操作は、5つとも同じです。
| 版 | 中身 |
|---|---|
| X1 すなお | 落ち着いた標準の版 |
| X2 にぎやか | X1 と同じ動きに、音・光・粒・画面のゆれを足した |
| X3 なみ | 速さが波のように上がったり下がったりする |
| X4 すれすれ | ぎりぎりでよけると +2点のボーナス |
| X5 はやい | はじめから速く、短い時間で勝負がつく |
遊ぶ前に、全部固定した
結果を見てから都合よく解釈できないように、人間が遊ぶ前に次のものを順番に固定しました。
- ルール:成功条件、比べ方、ボットの計算式。ゲームを作る前に固定
- AIの面白さの基準:「手ごたえ」「公平さ」「緊張と息つぎ」など6つ。これもゲームを作る前に固定
- AIの予想順位:5つの版を作ったあと、ボットで測る前に固定
- ボットの数値順位:#02 で直したボットで各200回ずつ遊ばせ、決めておいた計算式で順位を出して固定
- ページの対応表:X1〜X5 を P〜T に乱数で割り当て、中身を確かめるためのハッシュ値だけを公開
AIの予想・ボットの結果・対応表は、人間が評価を出すまで公開しない場所に置きました。比べ方も、順位相関だけでなく「1位が当たったか」「上位2作品がいくつ一致したか」「順位が完全に一致したのはいくつか」の4つを、AIとボットに同じように当てはめると決めました。
人間は P〜T をブラインドで遊んだ
評価した人は、どれがどの版か知らないまま、スマートフォンで P〜T を3回ずつ遊び、5段階の評価と最終順位をつけました(人の報告)。
P:1 Q:2 R:2 S:3 T:2 順位:S → Q → R → T → P
開けてみた
評価を受け取ってから、封印していたファイルを開きました。ファイルはすべて、固定したときのハッシュ値と一致しています。
対応表は P=X4、Q=X5、R=X3、S=X2、T=X1 でした。
| 1位 | 2位 | 3位 | 4位 | 5位 | |
|---|---|---|---|---|---|
| 人間 | X2 | X5 | X3 | X1 | X4 |
| AIの予想 | X4 | X2 | X3 | X1 | X5 |
| ボットの数値 | X1 | X2 | X4 | X3 | X5 |
(ボットの数値では X1・X2・X4 が同点。決めておいたとおり、番号順に並べています)
答え合わせ
| 尺度 | AIの予想 | ボットの数値 | でたらめに並べた場合 |
|---|---|---|---|
| 順位相関 | −0.300 | −0.335 | 0 |
| 1位が当たったか | 外れ | 外れ | 20% の確率 |
| 上位2作品の一致 | 1つ | 1つ | 平均 0.8 |
| 順位が完全に一致 | 2つ | 0 | 平均 1 |
決めておいた基準では、順位相関が 0 以下なら「外れた」です。AIの予想もボットの数値も「外れた」 でした。AIとボットの差は 0.035 で、基準では「差はほとんどない」です。
AIの1位は、人間の5位だった
AIは、ぎりぎりでよけるとボーナスが入る X4 を1位に予想しました。理由は、「危なかった」が得点という目に見える形になり、ぎりぎりを狙うか安全にいくかを選べて、腕の差と上達の実感が出やすい、というものでした。
人間は、その X4 を 5位 にしました。
人間の1位は、音・光・粒・画面のゆれを足した X2。AIはこれを2位に予想していました。そして、AIが「見てから反応する余裕が少なく、公平さが低い」として最下位にした X5 は、人間の2位でした。
なぜそう感じたのかは、感想の報告がないので分かりません。
ボットには見えないものがあった
ボットは画面を見ずに、ゲームの内部の様子だけで遊びます。そのため、見た目と音だけが違う X2 を、X1 と区別できませんでした(同点)。
人間の1位は、その「ボットには見えない違い」を足した X2 でした。
今回分かったこと
- AIは、5つの版を作り、予想・測定・対応表を人間が遊ぶ前にすべて固定して、ブラインドの比較を最後までやり通せた
- 今回の条件では、AIの判断による予想も、ボットの数値も、人間の順位と一致しなかった(どちらも「外れた」)
- 物差しを「数値」から「AIの判断」に変えても、人間とのずれは縮まらなかった(差は 0.035)
- AIが1位に予想した X4 が人間の最下位になり、AIが最下位にした X5 が人間の2位になった
- ボットには、見た目や音の違いが見えない
- 先に全部固定していたので、結果を見てから言い訳する余地がなく、「外れた」とはっきり言える
今回分からなかったこと
- 評価する人や作品を増やしても、同じ結果になるか
- 人間が X4 を最下位にし、X5 を2位にした理由
- #02 で同じ土台のゲームを遊んだ経験が、評価にどう影響したか
評価は1人、作品は5つで、5段階の評価も全体に低め(最高で3)でした。この結果だけで「AIは人間の面白さを予想できない」とは言えません。
次の実験につながる問い
- 人間に短い感想をもらいながらAIが直したら、人間の評価は上がるか
- 評価する人を増やしたら、AIの予想はどのくらい当たるか
- ボットに「見た目や音」を測らせることはできるか
くわしい手順・数字・証拠は、実験#03 の記録ページ の「詳細な実験記録」に残しています。
まとめ
#02 では「AIの数字で良くなったのに、人間は最初の版を選んだ」。#03 では「AIが1位に予想した版を、人間は最下位にした」。AIは予想を立て、その予想が外れたことを、ごまかせない形で記録できました。外れたからこそ、次に何を確かめればいいかが、少しはっきりしました。
証拠(実際の画面・記録)
画像をタップすると、元の大きさで開きます。
- ゲームを作る前に固定したルール・成功条件・比べ方・ボットの計算式
- 人間の評価の前に固定したもののハッシュ値
- AIの予想順位と理由(封印していたものをそのまま公開)
- ボットの数値順位(封印していたものをそのまま公開)
- 人間のブラインド評価の結果(人の報告)
- 開示と答え合わせ(ハッシュ値の一致・4つの尺度・判定)
この記事について
- 確かめたこと
- AIは、人間が「面白い」と感じるものを、遊ぶ前に当てられるか
- 試した日
- 2026年10月3日
- 環境
- Claude Code(クラウド上の作業環境) / Chromium(Playwright)でボットを実行 / 人の評価:スマートフォン
- 費用
- 追加の有料サービスは使っていない(Claude Code の利用料金は不明)
- 使ったAI
- Claude Code(Anthropic)
- AIの役割
- 実験の企画、ルールと評価基準の固定、5つの版の制作、予想とボットの測定、答え合わせの計算、記録と記事の下書き
- 人の確認
- 確認済み(2026年10月4日)