1 ポイント 投稿者 GN⁺ 3 시간 전 | 1件のコメント | WhatsAppで共有
  • 7つのフロンティアモデルで1,008件のSVGを比較した結果、有名なプロンプトに合わせて性能を引き上げる pelicanmaxxing の明確な証拠は見つからなかった
  • 8種の動物と6種の乗り物を組み合わせた48個のプロンプトをモデルごとに3回実行し、GPT-5.6 Luna で動物・乗り物・行動の一貫性をそれぞれ1~5点で評価した
  • ペリカンは動物8種中6位、自転車は乗り物6種中5位で、ペリカン-自転車の組み合わせも全48件中 42位 にとどまった
  • 難易度を補正した回帰分析でも研究所ごとの効果は統計的に有意ではなく、唯一有意だった Gemini 3.5 Flash の自転車効果も 多重比較補正 を通過できなかった
  • ペリカン-自転車の画像21件はすべて右向きだったが、全画像の60%も同じ向きであり、この実験だけではSVG生成全般を強化する SVGmaxxing の有無は判定できない

「自転車に乗るペリカン」ベンチマーク

  • Simon Willison は何年にもわたり、主要なLLMがリリースされるたびに「自転車に乗るペリカンのSVGを生成せよ」という同じプロンプトを試してきた
  • いたずら半分で始まったこのテストは、有名な非公式AIベンチマークとなり、新モデルを紹介する Hacker News スレッドでも関連結果が多くの支持を集めている
  • benchmaxxing は、人気ベンチマークで高得点を取れるようAIモデルを最適化する行為を指す
  • モデル性能がユーザーの選択に影響しうるだけに、研究所がこの特定テストに合わせてモデルを最適化する pelicanmaxxing の可能性を検証した
  • 実験コードとデータ処理パイプラインは GitHubリポジトリ で公開されている

1,008件のSVGを作成した実験設計

  • 8種の動物と6種の乗り物を組み合わせて 48個のプロンプト を構成した
    • 動物: pelican, flamingo, heron, otter, raccoon, antelope, whale, cat
    • 乗り物: bicycle, unicycle, skateboard, scooter, plane, boat
  • すべてのプロンプトは、Simon Willison の文面から動物と乗り物だけを置き換えた
  • 動物と乗り物は厳密な手順で選定したわけではないが、元の題材との類似性と難易度に幅が出るよう構成した
    • flamingo と heron は pelican に似ている
    • cat、raccoon、otter は容易な例として選んだ
    • antelope は難しく、whale は pelican と大きく異なる例である
  • OpenRouter を通じて次の7モデルを試験した
    • GPT-5.6 Terra
    • Claude Sonnet 5
    • Gemini 3.5 Flash
    • Grok 4.5
    • Qwen3.7-Max
    • GLM-5.2
    • DeepSeek V4 Pro
  • 各プロンプトで temperature 1.0、同一の推論努力設定で3サンプルを生成し、合計 1,008件のSVG を得た

レンダリング・評価・特徴抽出パイプライン

  • 生成結果は3段階で処理した
    • レンダリング: SVGをPNGに変換し、SVGがないかレンダリングに失敗した場合は有効な結果が出るまで再生成した
      • 1,008回の生成過程で11回再試行した
    • 評価: GPT-5.6 Luna が動物・乗り物・行動の一貫性をそれぞれ1~5点で採点した
      • 動物と乗り物の順位には各項目の個別スコアを用いた
      • 画像ごとに単一の数値が必要な場合は、3つの点数の平均である 評価スコア(judge score) を用いた
    • 特徴抽出: Gemini 3.1 Flash-Lite が認識した動物と乗り物、被写体の向き、場面要素を記録した
  • 研究所が特定ベンチマークを学習しているなら、ペリカンの行、自転車の列、またはペリカン-自転車のセルが本来の難易度以上のスコアを取るはずだと仮定した

目視比較で見えた違い

  • モデルごとの全画像グリッドを比較したが、ペリカン-自転車の画像が同じモデルの他の結果より明らかに優れている例は見つからなかった
  • GLM-5.2 の最初のサンプルはやや良く見えたが、同じまとまりの中でも高品質な heron-skateboard 画像が生成されており、特別な最適化の結果とは判断しにくかった
  • 良いペリカン-自転車画像を作った研究所は、他の動物・乗り物の組み合わせも上手く描く傾向があった
  • 目視評価は再現しにくく人によって判断が分かれるため、定量分析を追加した

ペリカンと自転車の個別成績

  • すべてのモデルの動物スコアを合算すると、ペリカンは8種中 6位 だった
    • cat、whale、raccoon、heron、antelope より低い
    • 7つの研究所すべてが cat、whale、raccoon を pelican より上手く描いた
  • ペリカン自体が cat より描きにくい可能性があるため、この順位だけでは別個の学習可能性を否定できない
  • 自転車は6種の乗り物中 下から2番目 で、最下位の plane とほぼ同水準だった
  • 自転車には、対応する2つの車輪、両輪の車軸をつなぐフレーム、ハンドル、座席、ペダルが必要である
    • 評価モデルは自転車画像の約 3分の2 で、これらの要素のいずれかが欠けているか正しく接続されていないと判断した
  • 自転車も skateboard のような単純な乗り物より難しいため、個別に学習していても相対順位が低い可能性はある

plane プロンプトが生んだ曖昧さ

  • 「airplane」ではなく「plane」を使ったことで、一部モデルはこれを航空機ではなく 幾何学的な平面 と解釈した
  • その結果、動物が航空機に乗るのではなく、平らな面の上に立っている画像が生成された
  • 特徴抽出器が乗り物をまったく見つけられなかった例は plane でのみ現れた
    • plane 画像168件中 25件 で乗り物を認識できなかった
    • 残り5種の乗り物ではこのような例はなかった
  • plane 画像の20%が乗り物スコア1点または2点を受けた
    • bicycle は5%だった
    • boat、scooter、skateboard には1~2点の画像がなかった

組み合わせ別順位と難易度補正

  • ペリカン-自転車の組み合わせの平均成績は、48組み合わせ中 42位 だった
  • 組み合わせごとに本来の難易度が異なる可能性があるため、1,008画像全体に固定効果回帰分析を適用した
    • 基本式は score ~ lab + animal × vehicle である
    • 研究所ごとの pelican、bicycle、pelican-bicycle 相互作用項を追加した
    • 頑健標準誤差を用いた
  • animal × vehicle 項は48組み合わせそれぞれの固有難易度を吸収する
  • 研究所ごとの相互作用項で、平均的な研究所に対する ベンチマーク特化の上乗せ分 と信頼区間を測定した

回帰分析では有意な効果は見つからず

  • 研究所ごとのペリカン効果は -0.11点から +0.14点の範囲で、いずれも統計的に有意ではなかった
    • 最小の p値 でも 0.25 だった
  • 研究所ごとの自転車効果は、Grok 4.5 の -0.18点(p=0.11) から Gemini 3.5 Flash の +0.27点(p=0.022) まで分布した
    • 7つの効果の向きは正負に分かれた
    • p<0.05 を満たしたモデルは Gemini 3.5 Flash だけだった
  • 各研究所のペリカン効果と自転車効果を除いた上で、特定のペリカン-自転車組み合わせで追加的に得られる上乗せ分は、すべて p<0.05 を満たさなかった
    • 最大の正の効果は GLM-5.2 の +0.35点 だったが p=0.12 だった
    • 実験で最もシグナルに近い結果だったが、偶然の範囲にとどまった
  • ペリカン効果とペリカン-自転車セル効果のすべての信頼区間は0を含んでいた
  • 21件の検定を p<0.05 で行うと、偶然だけでも約1件の偽陽性が予想される
    • 21 × 0.05 ≈ 1.05 であり、実際の有意結果も Gemini の自転車効果1件だけだった
    • Bonferroni 補正の閾値は 0.05/21 ≈ 0.002 で、Gemini の p=0.022 はこれを通過しなかった
  • 信頼区間の幅は平均で約 ±0.6点 であり、これより小さい上乗せ効果はこの実験では捉えにくい

右向きの画像構図

  • 7つの研究所が生成したペリカン-自転車画像 21件すべて が右向きだった
    • 48組み合わせの中で、全画像の向きが一致した唯一の組み合わせである
  • ただし全1,008画像の60%が右向きであり、右向き自体は一般的である
  • 乗り物別の右向き比率は scooter 83%、bicycle 81%、skateboard 60%、plane 58%、unicycle 45%、boat 35% だった
  • 動物別の右向き比率は antelope と pelican がそれぞれ78%、heron 77%、whale 65%、flamingo 64%、otter 45%、cat 40%、raccoon 36% だった
  • ペリカンや自転車を正面から描くのは難しいため、モデルは概して左右の側面構図を選び、そのため向きが曖昧な画像も少ない
  • 他の組み合わせでも高い方向一致率が見られた
    • antelope-scooter と pelican-scooter はそれぞれ21件中20件が同じ向きだった
    • heron-bicycle は21件中19件が同じ向きだった
  • 48組み合わせ中1つで21画像すべてが同じ向きを示したという結果だけでは、特別な外れ値とは言いにくい

場面要素から記憶の痕跡を探す

  • Gemini 3.1 Flash-Lite が画像内で見つけた場面要素を自由形式で抽出し、記憶された構図 が繰り返されていないかを調べた
  • 一部の組み合わせでは、特定の要素が頻繁に繰り返された
    • flamingo-boat 画像にはすべて太陽が登場した
    • otter-plane 画像の38%にはスカーフが現れた
    • cat-bicycle 画像の38%にはかごが含まれていた
  • ペリカン-自転車でも一部要素の頻度は高かったが、他の動物・乗り物組み合わせと区別できる特別な反復パターンは見つからなかった

単一の評価モデルと限られた予算

  • すべてのスコアは、単一の評価モデル GPT-5.6 Luna が画像を1枚ずつ見て付けた
    • 評価基準の整合は十分に行っておらず、再評価時の一貫性も確認していない
    • 評価モデルが画像を信頼できる形で判断できないなら、定量結果の価値は低くなる
  • 評価モデルと参加モデルの GPT-5.6 Terra が同じ製品群であるという制約もある
    • ただし各研究所が48組み合わせすべてを生成しているため、特定研究所の画風を好んでも全グリッドのスコアが一緒に上がる
    • 分析は研究所内部での組み合わせ差を比較するため、このような嗜好が主要結果を変えることはない
  • 特定プロンプトではなく、SVG生成全体や「乗り物に乗る動物」のようなカテゴリ全体を最適化する SVGmaxxing は検出できない
    • すべてのセルの性能が一緒に上がるため、単にSVG生成が上手いモデルと区別できない
    • Google/DeepMind はこの種の最適化を 公に実施 している
  • 実験全体の費用はAPIクレジットで約 80ドル だった
    • セルあたり3サンプル、評価モデル1つ、参加モデル7つに制限された
    • プロンプトとパイプラインを十分に繰り返して改善できず、「plane」と「airplane」のような問題が残った

特定プロンプト最適化の証拠はない

  • ペリカンは他の動物より上手く描かれておらず、自転車も他の乗り物より優れておらず、どの研究所も個別のペリカン・自転車性能から予想される水準以上にその組み合わせを有意に上手く描けなかった
  • GLM-5.2 は特定のペリカン-自転車セルで最大の上乗せを記録したが、効果は小さく統計的にも有意ではない
  • 21画像がすべて右向きだった点は目立つが、全体として右向き構図は一般的で、他の3組み合わせも90%以上の一致率を記録した
  • 特定ベンチマークだけを狙う pelicanmaxxing より、SVG生成全般を強化する SVGmaxxing のほうがありうる形だが、この実験だけではどの研究所がそれを行っているかは判別できない

1件のコメント

 
GN⁺ 3 시간 전
Hacker News の意見
  • ほかの動物と乗り物の組み合わせも合間に確認してみたが、特定の AI 研究所だけが 自転車に乗ったペリカンをやけにうまく描ける、という証拠を見つけるのが夢だった。
    Dylan が 8×6 の組み合わせで 1,008 個の SVGを生成した方法論は、自分が想像していたよりずっと堅実だった。ただし、どのモデルでも自転車に乗ったペリカンがほかの組み合わせより目立ってよく出た例は見つからなかった。

    • ペリカンだけに最適化したのではなく、SVG 全般に最適化した可能性もある。複雑な SVG 生成は汎用プログラミング能力や空間知識を試せるため、当初はよいベンチマークだったが、この課題だけを直接攻略するならそれほど難しくない。
    • SQL ベンチマークを作った TPC でも似たことがあった。TPC 性能が悪ければ競争資格がなく、よければ顧客の実際の課題を扱う比較評価に参加する資格を得る、という構造だった。
      混雑した市場ではベンチマーク通過が入場料になるが、特定の場面だけをハードコードし、隣接する問題を改善しないような狭い最適化は困る。GPU 分野の ATI カード向け “Quack3” ベンチマークを思い出す。
    • より根本的なテストは、SVG による画像生成全般を評価することだ。任意の画像に説明を付け、LLM に SVG 生成を依頼し、それをラスタライズして決定論的な視覚類似度で比較するか、別の LLM に元画像との類似度を採点させるパイプラインを作れる。
    • 鳥の種類も変えてみる価値がある。ペリカンと同じペリカン目のハシビロコウやサギも候補になり得る。
  • 自転車に乗ったペリカンが右を向くのは自然だ。自転車の駆動系は右側にあるため、フレームに隠れず見せようとすると右側面を描くことになり、学習データにもこうした構図が反映されている可能性が高い。
    根拠: https://www.rei.com/c/bikes
    よく見ると、動物の向きに関係なくすべての自転車が右を向いており、クジラを除く乗り手の両脚もすべて自転車の右側に置かれている。これは、自転車の仕組みに対する実質的な理解が大きく不足していることを示唆している。

  • Simon Willison が SVG を投稿するたびに、「今度こそ学習したはずだ」として評価を無視する反応が付いて回ったが、そうした学習をどれほど簡単に検出できるかを論理的に説明した記事もあった。小さな動物たちが自転車に乗る結果を定量分析してくれたのはうれしい。
    https://simonwillison.net/2025/Nov/13/training-for-pelicans-...

    • もっと穏当な可能性もある。以前は自転車に乗ったペリカンのイラストはほとんどなかったが、今では腕のある作家が自ら描いた素材が生まれており、研究所がほかのウェブ資料と同じようにそれを収集することで性能が上がる可能性がある。
      今回の結果は、まだそうした改善すら起きていないことを示している。むしろオンライン上の悪い結果を学習して性能が低下した可能性もある。
    • 少数の動物・乗り物の組み合わせで一般化した結果だけでは、その資料を直接または広範に学習していないという強い証拠にはなりにくい。
  • よりもっともらしい説明が SVG 最適化だとすれば、ここでいう「最適化」が何を意味するのかも考える必要がある。SVG をよりうまく描く能力そのものは有用なスキルだ。

    • AI 研究所が技術を最大化すること自体は恐ろしいことではない。ベンチマークは現在のモデルを定量比較できる事実上唯一の手段なので、ベンチマーク最適化に不満があるなら、よりよいベンチマーク作りに貢献するほうがよい。
  • 似た実験にひとつ変形を加えた。特定の鳥や移動手段を指定しなかった場合でも、モデルが自ら自転車に乗ったペリカンを選ぶかを確認した。
    結果: https://www.modelbias.ai/pelican-on-a-bicycle-test

    • 単純な絵にもかかわらず、スケートボードに乗ったペンギンの中には美的に優れた結果があり、低性能なモデルでも出ていた。Opus 系は時間が経つにつれて、むしろ結果が悪化したように見える。
    • 主観的評価が不要で、動物と移動手段の複雑さにも左右されにくいため、元記事の分析より説得力があり堅牢だ。
  • 元データは GitHub で公開されている: https://github.com/dylanjcastillo/blog/tree/main/_extras/pel...

  • LLM に SVG を作らせるのは、人間の画家に座標のリストを読み上げて絵を描かせるのに近く、非常に難しく不自然だ。最近の画像生成モデルは、構造が完璧な自転車と写実的なペリカンを簡単に作れるが、結果はラスタ画像にすぎない。
    画像をSVG パスや筆致コマンドに分解して再現する段階が欠けており、これをきちんと行うには場面構造への真の理解が必要だが、AI はまだここが弱い。

    • 優れた人間の画家は頭の中で描く過程を視覚化できるし、それは LLM が内部で SVG を構成することと大きく違わないかもしれない。Anthropic は最近この内部空間を workspace と表現しており、SVG に慣れていない人間にだけ奇妙に感じられる可能性がある。
    • このテストはラスタではなく、SVG 生成そのものを評価している。
    • Image2 のようにテキスト出力をサポートする画像モデルや、Claude のように画像を読める汎用テキストモデルは、ラスタ画像をベクター化できる。ただし品質はまだ低く、非専門家が Inkscape で手作業した結果のほうがよい。
  • LLM の出力を採点する方法として知られた瞬間から、資金決定者や研究所がその指標に関心を持ち、補正し始める。最良の場合は SVG 能力全般を改善しつつペリカン生成も同時に最適化するだろうが、すでに知られた尺度になった以上、信頼できる独立評価としては使いにくくなる。