- 顔認識が空港・店舗・オンライン写真にまで広く浸透するなか、現実的な外見の変更だけで管理された1:1本人確認を回避するのは非常に難しい
- パンデミック以降、システムが目の周辺の特徴により依存するようになった可能性があり、マスク・サングラス・極端なメイクは顔を変えるというより検出を妨げる手段に近い
- 監視映像のような1:N識別では、低品質画像、遮蔽、正面回避、モーションブラーがマッチングを揺るがす可能性があるが、効果はアルゴリズム・しきい値・撮影条件に左右される
- 特殊な眼鏡、メイク、フェイスマスクのような能動的回避も可能だが、誰にでも通用する攻撃は信頼性が低く、個人に合わせた方法はより多くの手間が必要
- 顔認識の回避は技術の普及とオンラインでの顔露出のためにますます難しくなっており、長期的な防御は顔を変えることより生体情報の規制に近い
顔を変えて顔認識を避けられるのか
- AIモデルとカメラさえあれば生体データは収集されうるため、空港の保安や店舗の入退場のような日常的な場面でも顔認識にさらされる可能性がある
- 核心的な問いは、顔の特徴を隠したり外見を大きく変えたりしてAIアルゴリズムを欺けるのかどうかである
- 現時点で最も確実な回避方法はカメラを避けることだが、顔認識技術がさらに広く配備されれば、この方法も難しくなる可能性がある
- プライバシーの専門家は、生体情報保護ではすでに不利な立場に置かれている可能性があり、長期的には連邦規制が実質的な防御手段になりうると見ている
単純な顔の変化に強い最新システム
- Cynthia Rudinは、最先端の顔認識を欺けるほど現実的に顔を変えるのは難しいと評価している
- パンデミックの間、多くの人が鼻と口をマスクで覆ったことで、システムが目の形により大きく依存するよう変化した可能性がある
- 目の形を現実的に変えてシステムを欺く方法は明確ではない
- サングラス、マスク、極端なメイクは顔検出を難しくできるが、これは顔そのものを変えるというより隠す方法に近い
- 美容整形のような極端な変化で認識システムを欺けたとしても、名前付きの顔写真がインターネットに上がれば、検索ベースの顔認識が再び識別できる可能性がある
- 友人がソーシャルメディアでタグ付けしたり、講演動画がオンラインに公開されたりする場合がその例である
- 変わった顔が運転免許証やパスポートと一致しなければ、旅行が難しくなる可能性がある
1:1確認と1:N識別の違い
- Walter Scheirerは、顔認識回避の難易度はアルゴリズムの使われ方によって異なると見ている
- 人間の生体認証には一般に1:1確認と1:N識別という2つのマッチング方式がある
- 1:1は、カメラの前にいる人が主張する身元がデータベースの登録写真と一致するかを確認する
- この方式は、高セキュリティのコンピュータ認証、法執行機関の捜査、空港での国際線搭乗のような場面で使われる
- 1:Nは、未知の被写体の写真を、注目対象となる身元の登録写真群と比較する
- この方式は、法執行や政府の情報活動を含む映像ベースの監視環境でよく使われる
- 管理された1:1環境では回避は非常に難しい
- 正面姿勢、中立表情、良好な照明、管理された背景で撮影されると、メイク、ひげの追加・除去、ヘアスタイル変更のような基本的な回避は効果がない
- 最新の人工ニューラルネットワークベースの顔認識は、同一人物のさまざまな外見変化に対しても高いマッチング精度を示す
- 美容整形の影響に関する最近の研究では、美観を損ねるような極端な顔の構造変更はある程度効果を持ちうる一方、一般的な美容施術の影響は思ったほど大きくない
監視環境では画像品質を下げる方法が現実的
- 非管理の監視環境における1:N識別には、外科的処置なしでも比較的回避の余地がある
- 優れたニューラルネットワークでも、顔の情報量が多いピクセルが不足する低品質写真では苦戦し、候補となる身元の一覧が多いほどさらに難しくなる
- 回避方法は、アルゴリズムが良質な顔ピクセルを得られないようにすることに集中する
- 不審でない状況では、冬のスカーフや晴天時のサングラスのように顔を隠せる
- つばの広い帽子は額や髪を隠し、顔に影を作って妨害要素になる
- 手で顔を隠すことも助けになる
- 移動中に下を向けば、周囲のカメラは良好な正面顔画像を得にくい
- ジョギングや自転車のように速く動けば、撮影画像にモーションブラーが生じる可能性がある
- 最も実用的な助言は、顔認識が配備されている場所を知り、その区域を避けることである
- この助言がどれだけ長く有効かは、今後顔認識技術がどこまで広く普及するかにかかっている
敵対的攻撃と個人向けの外見変更
- Xiaoming Liuは、顔認識システムがカメラに写った被写体の顔を認識できない状態を「顔認識回避」と定義している
- 顔認識システムを能動的に失敗させる方法として、物理的敵対的攻撃がある
- AIモデルは入力データのわずかな変更だけでも失敗しうるが、顔認識システムもその例外ではない
- 核心は、顔認識システムを失敗させる特定の小さな変更を見つけることにある
- CMUの特殊な眼鏡の事例のように、眼鏡によって顔認識システムを失敗させる研究がある
- 同様の方法で、スカーフ、フェイスマスク、口ひげも設計できる
- 外見を変えて別人と誤認させる方法もある
- 一般的な方法はメイクである
- どこにどれだけメイクすべきかは個人ごとに異なる
- 顔がよりありふれていて他人と似ている人は、比較的小さなメイクの変化でも誤認されうる
- 顔が非常に独特な人は、はるかに大きなメイクの変化が必要になる
- スマートフォンアプリがカメラで顔を見て、どこからどの色でメイクすれば最小限のメイクで顔認識システムに誤認させられるかを反復的に案内する応用も可能である
- 高価なフェイスマスクも使えるが、これはハリウッド映画でより一般的な方法である
- 方法1は利用者にとってより簡単だが、誰にでも通用する汎用的な敵対的攻撃は信頼性が低い
- 方法2はより個人化されていて、よりうまく機能する可能性があるが、その分より多くの手間が必要になる
埋め込みとしきい値が回避難易度を左右する
- Kevin W. Bowyerは、答えは顔マッチングアルゴリズムと、そのアルゴリズムで用いられるしきい値にかかっていると見ている
- 顔認識とは、2つの画像を比較して、同一人物と見なせるほど似ているか、別人と見なせるほど異なるかを判断する過程である
- 各顔認識アルゴリズムは顔画像から特徴ベクトル、つまり埋め込みを計算し、2つの特徴ベクトルの類似度を比較する
- 1枚の顔画像は512個の数値のリストに縮約されうる
- 2枚の顔画像の類似度は0〜100や-1〜+1のような範囲で出力されうる
- 100や+1は同一画像のコピー同士を比較した場合にしか出ず、実際の状況ではまれな結果である
- 最新のアルゴリズムで-1〜+1の範囲を使うと仮定すると、別人同士の画像ペアの類似度は0.0付近、または少し上に集まりうる
- 同一人物のさまざまな画像ペアは、0.8付近、または少し上に集まりうる
- 運転免許証写真のように撮影条件がよく管理されていれば、同一人物2画像の平均類似度はより高くなる
- 店舗入店時の映像フレームのように条件があまり管理されていなければ、同一人物2画像の平均類似度はより低くなる
- しきい値が0.7に設定されているなら、2画像の類似度が0.7未満のときシステムは別人と判断し、0.7以上なら同一人物と判断する
- 「どれだけ外見を変えればよいのか」という問いは、「新しい画像を既存画像と比較する際、類似度の値を下げる最良の方法は何か」に置き換えられる
- 可能な方法には、濃いサングラス、ヘアスタイル変更、大げさな表情、カメラを正面から見ないこと、体重の増減、メイクなどがある
- どの方法でも、既存写真と一致しないことを保証することはできない
- 比較に使われる既存写真が分からない可能性がある
- 使用されるアルゴリズムとしきい値も分からない可能性がある
- この3つをすべて把握できれば、最も効果的なアプローチを実験できる
1件のコメント
Hacker News のコメント
国際線の空港で搭乗券とパスポートを確認せずにそのまま通されたのに、ゲートを通るときに座席番号を教えられて、似たようなことを考えたことがある。
メキシコでは、タイムシェアを売る空港職員が過剰に攻撃的に腕をつかんで立ち去れないようにしたので通報したところ、空港側は空港内での自分の全移動が映った映像をすぐに見せて、その職員を特定してくれた。
記事が言うように、こうしたシステムがどこにでも敷かれるのは時間の問題だと思う。公共交通のハブでは、すでにほとんど反対もなく慣れられているし、やがて自治体や民間施設も導入するだろう。そのときには「空港でももうやっているじゃないか」と、食料品店や歩道で何を大騒ぎしているのか、という空気になる可能性が高い。
生涯で飛行機に一、二度しか乗らない人は、混乱して忙しい状況を切り抜けることに気を取られ、顔認識が新しいものだとか、9/11以降の特別措置ではないことまで気づくのは難しい。米国人の多くは外国にまったく行ったことがないか、一国だけ行ったことがある程度で、しかもメキシコやカナダのように車や徒歩で行く場合が多い。
自宅近くのような慣れた日常の中でこういうことが起きれば、ストレスが少なく考える余裕もあるので、少なくとも立ち止まって何が起きているのか尋ねることになりそうだ。
データベース上のキューポイントを使って映像ライブラリから編集版を素早く組み立てる仕事をしたことがある立場からすると、かなり面白い問題だ。最終的な映像はスパイ映画のように良いアングルをつなぎ合わせたカット編集版だったのか、到着便を特定した時点から複数カメラが同時に見えるマルチカム画面だったのか、システムが「把握している」とでも言うように人物の周囲にボックスを描いていたのかも気になる。
こういう顔認識システムが実際にどれほどディストピア的なのか知りたくなる。
顔認識はまったくなかったが、その経験以来、映像監視には好意的になった。
しかし全国規模の公開捜索では、誤検知率が高すぎてうまく機能しにくい。既知の場所と時間で起きた事故のようなローカルかつ時間的な文脈から外れ、特に米国のように自家用車の利用が広く普及している場所で多くの痕跡を残さない場合、こうしたシステムは実用上あまり役に立たないことが多い。
米国市民は入国時の写真撮影を拒否できるが、誰がその手間を引き受けるだろうか。そうやって回り続ける。
Helen Phillips の新作小説 Hum は、この問いをまさに扱っている。
前提はこうだ。職を失い生活に困っている女性が、最先端の顔認識ソフトウェアの試験対象になるため、高級ロボットによって顔をほんのわずかに外科的に変えられる研究に参加する。
夫は主に害虫駆除をするギグワーカーの修理工で収入がひどく少なく、幼い子どもが2人いて、退去させられるのを恐れて参加する。研究は、10か月間ほかの収入がなくても家族が楽に暮らせるほどの大金を前払いで支払う。
やがて問題が明らかになる。外見がごくわずかに変わっただけなのに、家族も知人もみな戸惑うのだ。以前とまったく同じに見えるが、どこか違うからだ。この研究は、監視映像が不気味の谷にある顔をどう処理するかを見るために、そうした顔を作り出すものなのだ。
この紹介は本の冒頭部分の内容なのでネタバレではなく、その後の物語は予想外で興味深い方向へ爆発していく。批評家に認められ受賞歴もある小説家の6作目となるSFで、文章が美しい。
最初の19ページはここで読める: https://www.amazon.com/Hum-Novel-Helen-Phillips/dp/166800883...
結論を見て、中国のラオ・ロンジーを思い出した。彼女は恋人のファ・ズーインとともに連続殺人犯であり[0]、2人は全国を回って恐喝と殺人を繰り返していた。
ファは1999年、警察とのにらみ合いの末に逮捕されたが、ラオは顔を変える整形手術まで受け、20年間逃亡した。ほとんどの人が気づかないほどだった。
しかしその20年の間に顔認識ソフトウェアは急速に発展し、ショッピングモールのカメラが彼女を認識して全国犯罪者データベースと照合した。最初は警察も誤検知だと思ったが、DNA証拠で同一人物だと確認され、最終的に処刑された。
今の時代、誰も顔認識から本当に身を隠すことはできないと思う。
[0] https://www.youtube.com/watch?v=I7D3mOHsVhg
「2021年9月9日、ラオは故意殺人、誘拐、強盗の罪でNanchang Intermediate People's Courtから死刑を言い渡された。政治的権利は終身剥奪され、すべての個人財産も没収された。ラオは判決を控訴し、二審は2022年8月18日にJiangxi Provincial Higher People's Courtで開かれた。ラオは自分がファの共犯者だったことは認めたが、関係を通じてファから身体的・性的虐待を受け、命を失うことを恐れていたからだと主張した。同年11月30日、裁判所は死刑を維持した。2023年12月18日、Supreme People's Courtの承認を受け、Nanchang Intermediate People's Courtがラオ・ロンジーの死刑を執行した。」
https://en.m.wikipedia.org/wiki/Fa_Ziying_and_Lao_Rongzhi
実際の一致度はもっと高かったのかもしれない。それでも現在の顔認識は、顔に対して一貫した「ハッシュ値」を与えるが、桁数や情報量が限られた方式のように見える。誰かがX便の乗客だという追加情報を知っていれば、どの人物かを非常に高い確率で推測できるが、特定の人物を大量に探し、誤検知を許容しない限り、大規模にはうまくスケールしない。
当局はDNAと顔認識が人を捕まえたと言いたがる。そう言えば当局が全知全能であるかのような印象を与えるからだ。上の「97.3%」のような値も、間違っているか意味がない可能性がある。もちろん、こうした技術が人を捕まえる場合はあるが、依然として限定的で高コストだ。
用意した自分の写真を公開しつつ、顔認識に本人だと認識されないようにするのが目的なら、実際には顔をそれほど大きく変える必要はない。https://sandlab.cs.uchicago.edu/fawkes/を見ればよい。
敵対的に用意した画像は、人間の目には依然として完全に本人に見えることがあり、顔認識を破るデータは、一般的な人間の知覚ではほとんどステガノグラフィに近い形でエンコードされる。
「政府に私たちを守る法律を作るよう求めるほうがずっと簡単だ…」という言葉は少しナイーブだ。データはすでにほとんど存在しており、別の政府が成立するだけでその保護は無力化され得るので、もう遅すぎる。
だからドイツ人と欧州人はかなり以前から、データ収集に対抗し保護措置を作るためにかなり強く闘ってきたし、おそらく最も洗練された政策と規制の一つを持っているはずだ。
しかし時間が経つと、データ収集を最小限に保つのはほぼ不可能になる。最初はそれ自体として妥当な小さな例外ができ、その後参加者が増え、正常化され、最終的には保護措置が残らなくなる。
今、あるいは近いうちに止めれば、芽を摘むことができる。私たちにとってもおそらく遅すぎるわけではない。頭蓋骨の形で顔を認識することは依然として懸念材料だが、それは悪意ある側が私たちの最新の映像を入手した場合に限られる。そうでなければ過去の活動だけを調べられる。
別種のデータには、長期的な有用性を妨げる制約がもっと多い。「瓶から出たジーニーは元に戻せない」という幻想に加担しないという前提では、そうだ。
襟元に、人間の目にはほとんど見えないが、たいていの CMOS チップには映り込み、カメラを眩ませるほど波長の低い明るい赤外線 LEDを、30Hz や 60Hz で点滅させて歩き回ったらどうなるのか、よく気になっていた。
買い物に行くたびにこんなことを考える。監視されるのは嫌だし、隠すこともないが、あの説得的で圧迫的な性質が嫌なのだ。これまでの人生で盗みをしたこともない。人が後をつけてくる程度ならまだ気にならないが、はるかに効果的で怖く、侵襲的なアルゴリズム解析は嫌だ。
おそらくこういう実験の結果は、退店を求められるか、警察との気まずいやり取りになるのだろう。それでも、自分より勇敢な誰かに試してみてほしい気持ちはある。服にライトを付けられるなら、なぜそれを赤外線にしてはいけないのか?
顔認識を避けるには、顔をどれくらい変えればいいのか? W.O.P.R. に着想を得た禁断の答えは、ゲームをしないことだ。
可能ならカメラのあるエリアを避ける。収益に影響を与える。
企業や取引先とは、可能なときは Zoom や Jitsi で通話する。
自給自足する。必要ないときにお金を使わず、健康的な食料品は配送してもらう。税収を減らす。
会社が許すなら在宅勤務をする。できるだけオフグリッドに近い生活をする。
避けられない用事は他人を雇う。近所の子どもに現金を渡して街まで行ってきてもらう。
こういうことを言っても誰にも人気が出ないのは分かっているが、自分はそういう人間だ。
全体として悪くない記事だが、実際の助言は、10年以上前にこの分野を最後に扱ったときと大きく変わっていない。
基本的には、上を見上げず、できるだけ顔を多く隠し、アルゴリズムが時間をまたいで同一人物として照合しにくいようにパターンを混ぜ、カメラの位置と避け方を把握し、既知の監視エリアに入らなければならないなら、できるだけ素早く静かに抜け出せばよい。特に被害妄想が強いなら、監視エリアの間で服装も変えたほうがいい。
ただし、政府の監視をだませるという期待は今すぐ捨てたほうがいい。有能な国家主体が特定の人物を狙っているなら、すでに網の中に入れているはずだ。古い食料品店のカメラによるぼやけた白黒アナログ映像からでも顔を照合できるだけの情報を、彼らはすでに持っている。
意味のある整形手術や義肢・補綴なしには勝てないし、仮にそうしても、彼らが本気で望めば、あなたが触った物から部分的な指紋を採取して確認するだろう。
セキュリティの第一原則は、誰かがあなたの持っているものを本当に切実に欲しがっているなら、それを防ぐ方法はないということだ。これを念頭に置いて計画すべきだ。だから私はデモには行かず、顔認識技術が導入されているイベントは避ける。過去の仕事のおかげで、高品質な基準データとともに、すでに何度もそのデータセットに入っており、パスポート写真や Global Entry へのアクセスによって更新もされている。
最も安全な選択は、そもそも自分をそういう場所に置かないことで、おそらく多くの人にとってもそれが最善だ。
より賢い議論では、生体情報の核心は「一度侵害されたら永遠に侵害されたまま」という点にある。生体情報はパスワードではなく、公開鍵やユーザー名に近い。
幸い、政府にはその言葉はそのまま当てはまらない。現在の政府が損なわれていても、民主的な手続きを通じて、再び損なわれていない状態に変えることができる。
だから、顔を変えるより政府を変えるほうが簡単だと言える。努力を注ぐべき場所はそちらだ。
米国全体のような巨大な母集団に適用し、時間的・地域的な文脈を無視した瞬間に衝突が生じる。センサーエラーであれ他の理由であれ、部分サンプルを考慮すると特にそうだ。
裁判所が、生体情報の照合は常に一致の可能性にすぎず、保証された一致ではないという現実を無視したせいで、無実の人が刑務所に入ったこともある。
サングラスをかけ、マスクや誇張したメイクのように顔に何かを施せば顔の検出は難しくなるが、それは顔を変えるのではなく隠すことだから「反則」だと言うなら、単にサングラスとマスクを着ければいい。反則かどうかなんて誰が気にするのか。