99.9%を取ったAI、はめ込みは20回中2回
独立評価団体Robocurveが、GPT-6 Astraにロボットアームを操作させた。積み木を器に入れる課題は20回中19回成功。一方、丸いピースを溝にはめる課題は20回中2回で止まった。
ひかり:いっけー! はいれー! ……よしっ、入ったーっ! これで19回目だよっ! ……ねえみずき、なんで一緒に喜んでくれないのー?
みずき:…赤い積み木を、器に落としただけでしょ。……で、それ誰得なの。
ことね:それが、けっこう誰得じゃないのよ。出しているのはRobocurveという団体でね。デモ動画のいいところだけ切り取るのではなく、ロボットが実際どこまでできるのかを、公開で測って報告することを仕事にしている独立の評価団体なの。今回はOpenAIのGPT-6 Astraに、2本腕のロボットアームを渡したのよ。課題は2つ。「机の上の赤い積み木を取って、器の中に入れる」。それと「丸い青いピースを、真ん中のつまみでつまんで、板の丸い溝にはめる」。各20回ずつね。……ひかりが応援していたほうの成績が、20回中19回。同じ仕掛けで測ったClaude Fable 5.1が8回、その前のFable 5が1回だから、かなりの差よ。しかも1回2.5分。Fable 5.1は6.8分かかっていたの。1回あたりの費用も0.94ドルと2.12ドルで、半分以下ね。
ひかり:えっ、すごっ! ことね先輩、6分が2分半っ! ……で、もうひとつのほうは? 穴にはめるやつっ!
ことね:……2回よ。20回中2回。Fable 5.1も、20回中2回。ここだけ差がつかなかったの。……この評価、失敗した回もどこまで行けたかを人が採点していてね。0が「近づきもしない」、1が「触った」、2が「持ち上げた」、3が「置き場所の真上まで運んだ」、4が「置けた」。Astraは、溝の真上まで運べたのが10回。そこから中に落とせたのが2回。平均の段でいうと、Astraが2.00でFable 5.1が2.35。完了数は同じで、平均はむしろ負けているのよ。
みずき:…一昨日ここで話した、あのモデルだよね。ルールを教えてもらえないゲームを自力で攻略する試験で99.9%取ったっていう、条件のいいほうの数字のやつ。……ルールのないゲームは解けて、幼児用の型はめは10回に1回。
ひかり:えー、逆じゃないっ!? どう考えてもはめるほうが簡単だよっ! わたし試験のほうは1問もわかんないもんっ!
ことね:ひかり、それが有名な話なのよ。モラベックのパラドックスというの。1980年代に指摘されたことでね、機械にとっては、難しい試験や理屈の計算のほうがむしろ安上がりで、赤ちゃんでもできる「見る・つかむ・歩く」のほうがとてつもなく高くつく、という話。理由もはっきりしていて、体を動かす技は生き物が何億年もかけて作り込んだ回路で、しかも本人の意識に上がってこないの。だから人間が言葉にして教えられないのよ。……あなたがいま箸で豆をつまめるのは、あなたが偉いからではなくて、ご先祖が長いこと練習したから。
みずき:…念のため言っとくと、この報告、自分で穴を書いてるよ。Astraの回だけ2日あとにやってて、混ぜて測ってない。器の課題は使った実験台まで違う。採点は人が見てて、どのモデルかも分かってた状態——「無意識の偏りが入りうる」って、向こうが先に書いてる。……そこまで書く相手を、疑うのも難しいんだけど。
ひなた:ふぁ〜……あの。ひなたのお弁当のふたも、1回でははまらないのです。……押して、ずらして、もう一回押すのです。……ロボットさんも、いっしょなのですね。
まとめ:ルールを教わらないゲームは、自力で解ける。丸いピースは、溝のふちまで運んだところで手が止まる。