1 ポイント 投稿者 GN⁺ 2025-04-27 | 1件のコメント | WhatsAppで共有
  • スマートフォンが会話を常時盗聴して広告を表示するという通念には明確な証拠がなく、実際の広告ターゲティングは 位置情報・関係性・行動データを組み合わせる方式に近い
  • 2024年の Cox Media Group の Active Listening 論争は、「real-time intent data」と音声データの利用資料によって広がったが、主要テック企業は CMG と距離を置き、CMG は製品を停止した
  • Wandera の2019年の実験では、iPhone と Samsung Galaxy に30分ずつペットフード広告の音声を聞かせた後、広告表示、データ使用量、バッテリー、バックグラウンド活動を比較したが、マイクの常時アップロードの痕跡は見つからなかった
  • Northeastern University の研究チームは17,000件以上の Android アプリを調査し、密かにマイクをオンにした事例は見つけられなかった一方、一部アプリが スクリーンショット・画面動画を第三者に送る、より直接的なプライバシー問題を発見した
  • Facebook のようなプラットフォームは、デバイス横断トラッキング、友人関係、位置情報、購入情報、Android の通話・SMS メタデータといった 大規模な個人データで関心を予測できるため、単純な盗聴より理解しにくく不透明な広告システムになっている

スマートフォン盗聴説が繰り返される理由

  • ソーシャルメディアで、たった今交わした会話とぴったり一致する広告を見ると、最も単純な解釈は マイクによる盗聴のように見える
  • Facebook、Google、Apple が私的な会話のキーワードを聞き取り、パーソナライズ広告を表示しているという話は、古くからあるテクノロジー陰謀論として定着している
  • しかし逸話的な事例を除けば、スマートフォンが私的な会話を常時聞いて広告に使っているという 明確な証拠は見つかっていない

2024年の Active Listening 論争

  • 2024年に 404 Media が公開した資料で、Cox Media Group(CMG) は Active Listening というシステムを紹介した
    • スマートデバイスのマイクから「real-time intent data」を取得できるという内容が含まれていた
    • 「voice data」を AI 処理や他の「behavioral data」と組み合わせ、高度にターゲティングされた広告を提供できるとしていた
  • Active Listening が実際にどのように動作していたのかは不明である
  • 論争の直後、主要テック企業は CMG と距離を置いた
    • Amazon は CMG と広告パートナーとして仕事をしたことはないと明らかにした
    • Google と Meta は CMG との関係を断った
    • CMG は Active Listening 製品を「誤解を避けるため」停止したと明らかにした
  • 理解できる範囲では、CMG のシステムはスマートフォンのマイクを24時間聞く方式ではなく、「Hey Google」や「Hey Siri」のようなウェイクワードの後にクラウドへ送られる 短い音声の断片を活用する方式に近い

Facebook Messenger の文字起こし論争と誤解

  • 2019年の Bloomberg 報道は、Facebook が Facebook Messenger の音声会話を外部業者に委託して文字起こしさせていたと明らかにした
  • Facebook は、自動文字起こしアルゴリズムの精度をテストするための手続きであり、文字起こし機能にオプトインしたユーザーは人によるレビューの可能性を認識していたと説明した
  • 一部の報道は、Facebook の通知がどれほど透明だったのかに疑問を呈した
  • この事件は「Facebook が私的な会話を聞いていた」という形の見出しで広がり、広告目的のマイク盗聴説を再び大きくした
  • Mark Zuckerberg は2018年4月、米国議会でマイクを通じてユーザーを聞き取り広告に活用しているのかと問われ、「私たちはそのようなことはしていない」と答えた
  • Facebook は2016年にも、スマートフォンのマイクを広告や News Feed に使っておらず、広告はユーザーの関心とプロフィール情報に基づいていると明らかにしている

Wandera の実験: データ使用量が合わない

  • モバイルセキュリティ企業 Wandera は2019年、スマートフォンが会話を聞き続けているのか確認するために 簡単な実験を行った
    • iPhone と Samsung Galaxy を部屋に置き、1日30分ずつ3日間、ペットフード広告の音声を再生した
    • 多くのアプリ権限を有効にした
    • 同じスマートフォンを静かな部屋にも置き、対照群として比較した
  • 実験では2点を確認した
    • 実験後、アプリのストリームにペットフード広告が表示されるか確認した
    • データ使用量、バッテリー使用量、バックグラウンド活動を追跡した
  • どのアプリにもペットフード広告は表示されなかった
  • 音声を流した部屋と静かな部屋の間で、データ使用量、バッテリー使用量、バックグラウンド活動の差もほとんどなかった
  • Wandera の James Mack は、30分間のテストデータが仮想アシスタントのデータ使用量よりはるかに少なく、テストされたアプリで常時録音とクラウドアップロードが行われていなかったことを示唆していると明らかにした
  • 元 Facebook プロダクトマネージャーの Antonio Garcia-Martinez も Wired 寄稿で、マイク監視には隠すのが難しいレベルのデータ使用量が必要になると計算した
    • 片方向の VoIP 通話は約24 kbps、秒あたり約3 kBのデータが必要
    • スマートフォンを1日の半分オンにしていると仮定すると、ユーザー1人あたり1日約130 MBになる
    • 米国の日次アクティブユーザー1億5,000万人を基準にすると、1日約20 PBが必要になる
    • Facebook 全体のデータ保存量は約300 PB、日次収集量は約600 TBと示されている
  • デバイス上でキーワードをローカル検出すればよいという反論もあるが、Facebook が追跡すべき広告キーワードは数百万個あり、CPU 負荷が目に見えるため隠すのは難しいという反論が出ている

マイクより直接的な追跡: 画面キャプチャ

  • Northeastern University の Jingjing Ren と Elleen Pan は2017年初め、スマートフォンがユーザーに内緒で会話を聞いているのか調べる研究を設計した
  • 研究チームは、密かにマイクが有効化される事例を見つけられなかった
  • 代わりに、一部アプリが自分の画面を自動的にキャプチャして第三者に送る事例を発見した
    • Christo Wilson は、音声流出はまったくなく、ある事例ではアプリが画面上の活動の動画を第三者に送っていたと明らかにした
  • 17,000件以上の Android アプリのうち、9,000件以上がスクリーンショットを撮れる潜在的な権限を持っていた
  • David Choffnes は、画面キャプチャは天井を撮るカメラや意味のない会話を録音するマイクより悪質になり得るうえ、このプライバシーホールを簡単に塞ぐ方法はないと明らかにした

広告ターゲティングはすでに十分なデータを持っている

  • Facebook は、マイクを通じた技術的な奇跡なしでも、弱いシグナルでユーザーをターゲティングできるより良い手段を持っている
  • Garcia-Martinez は、Facebook がユーザーが Facebook にアクセスしたすべてのデバイスでユーザーを見つけられ、小売業者が知っている情報やオフラインの現金購入まで活用できると見ている
  • プラットフォームが活用できるデータは多様である
    • ユーザーの現在地
    • 友人関係と友人たちの関心
    • ユーザーが誰と時間を過ごしているかに関する情報
    • 複数デバイスにまたがるトラッキング
    • Android スマートフォンの 通話・SMS メタデータ
    • 実際には送信せず削除した入力内容に関する 追跡可能性
  • こうしたデータがアルゴリズムで処理されると、ユーザーと友人たちが何について話しているのかを予測し、現在のニーズに合う広告を表示できる
  • 広告アルゴリズムは完璧ではなく、関心とまったく合わない広告も頻繁に表示される
  • それでも一部の広告がぞっとするほど正確であるため、ユーザーはマイク盗聴という単純な説明を受け入れやすい

音声アシスタントと常時録音の違い

  • 音声制御のスマートデバイスは、ある意味ではほぼ常にユーザーの言葉を「聞いて」いる
  • しかし動作方式は常時録音とは異なる
    • デバイスはローカルで「Hey Google」のようなウェイクワードを検知する
    • ウェイクワードが検知されると短時間オンになり、その後の数秒間の音声データを録音する
    • このデータをクラウドに送って応答を処理した後、結果をデバイスへ返す
  • こうしたデータ転送は検知・追跡が可能である
  • 問題はマイク盗聴よりも、無数の個人データポイントを追跡する複雑なアルゴリズムがどのように広告のタイミングを決めているのか、人間には理解しにくい点にある
  • スマートフォン広告の気味悪さは、単純な盗聴ではなく 複雑で不透明なデータ追跡から生じている

1件のコメント

 
GN⁺ 2025-04-27
Hacker News のコメント
  • この記事は、Jonathan Zeller が McSweeney's に書いた見事な風刺記事を思い出させる: Calm Down—Your Phone Isn’t Listening to Your Conversations. It’s Just Tracking Everything You Type, Every App You Use, Every Website You Visit, and Everywhere You Go in the Physical World
    https://www.mcsweeneys.net/articles/calm-down-your-phone-isn...

    • 複数の主体と共有される音声録音を「否定」することに、あまりにも多くの時間が費やされているのを見ると、むしろ疑わしく感じる
      Facebook の「私たちはデータを絶対に売らない(ただあなたを追跡し、そのデータで広告を売っているだけ)」に似ている。「私たちは音声を絶対に聞かない(ただし品質保証の改善のために分析する)」のような逃げ道がありそうだ
    • ある通信事業者の幹部が冗談で「銀行はあなたが昨夜どのホテルに泊まったかを知ることができるが、通信事業者はあなたが誰と寝たかを知っている」と言っていたのを思い出す
    • この記事は、実際には深刻なマイクデータの出所を一つ見落としている: スマート TV
      私の Toshiba Fire TV は、音声リモコンを使っていないときでも、聞こえる範囲内のすべての会話を聞き、広告ネットワークに売っていると確信している。もちろん原文の記事で述べられている画面認識もしているだろうが、私が言っているのは、部屋にいる人たちのリアルタイムの会話をマイクで収集しているということだ
  • 以前 Google が Twitter から大規模なデータを収集し、Google Maps の検索欄に Twitter のハンドル名を入れるだけで、Twitter を使った場所を表示できるようになっていたことを暴露したことがある
    Twitter で位置情報共有をオフにしていてもその位置を把握していたので、Twitter が Google に非公開で情報を提供していた場合にしか可能ではなかった。その「実験」はその後中止されたが、こうした暴露やいくつかの活動のせいで Twitter アカウントを永久に失い、正当な理由なく永久停止されたとして何度も復旧を求めたところ、X Support はすべての異議申し立てをデジタルごみ箱へ直行させる状態になった。もう何があっても驚かない

    • この実験はこれのこと? https://github.com/jkakavas/creepy https://www.geocreepy.com/
    • 関連資料のリンクをもらえる? かなり興味深く聞こえる
    • こういう内容を投稿しておいて、人々が確認できるような研究資料リンクを貼らないのは、本当に言い訳しづらい
    • どのサイトも、あらゆるサポート依頼を何らかの理由でデジタルごみ箱に入れているのでは? 新しいアカウントを作る。ただし、サイトが以前のアカウントと結び付けられないよう、可能な限り多くの手段を使うべきだと思う
  • これを書いている時点でのページタイトルは “Your phone isn’t secretly listening to you, but the truth is more disturbing” で、現在のこの投稿のタイトルも同じだ
    ところが読んでみると、実質的には Facebook に焦点を当てた記事にすぎない。「スマホがこっそり聞いているわけではない」という表現は誤解を招きかねない。記事はスマホが聞いていないことを証明しておらず、一部の企業はそうしていないかもしれない、という程度しか扱っていない。現実的には、スマホは十分に聞いている可能性がある。脆弱性を悪用してそれを行うマルウェア/スパイウェアは多く、NSO Group のような事例もある。公開市場で買えるツール以外にも、Mossad、NSA、主要な情報機関は、それよりさらに強力なツールを持っていると考えるべきだ。スマホが間違いなくあなたの音声を聞いている可能性はあるが、おそらくそうではないだろう
    https://www.bloomberg.com/news/features/2023-01-24/nso-group...
    https://www.britannica.com/topic/Pegasus-spyware
    https://citizenlab.ca/2016/08/million-dollar-dissident-iphon...
    https://newatlas.com/computers/smartphone-listening-conversa...
    https://www.bloomberg.com/news/features/2023-01-24/nso-group...

    • 全体として見れば、スマホは聞いていないが、強力な敵対者が大きな関心を持つような対象であれば、十分にあり得る
      ただし、その程度の状況なら、それは心配事リストの中では小さい部類に入る気がする
    • 最近のスマホは、カメラ/マイクが有効になるとステータスバーに表示する
  • ちなみに「スマート」TV もスクリーンショットを送信する
    [0] https://dl.acm.org/doi/10.1145/3646547.3689013

    • もはや「スマート」と付くものは何であれ、プライバシーを侵害すると安全に仮定できる段階に達している
  • 「アプリが自動的に自分の画面のスクリーンショットを撮って第三者に送信し、ある事例では画面上の操作動画を撮って第三者に送信した」という内容と、17,000個を超える Android アプリのうち9,000個以上にスクリーンショットを撮る潜在的な権限があったという内容があるが、それはどんな権限で、どのアプリがそんなことをしているのか、どう検知して防げるのか?

    • 画面録画の権限はある。ユーザーの同意が必要で、使用中はステータスバーにアイコンが表示される。こっそり使うことは不可能
      記事が言っているのは、アプリが自分自身のウィンドウのスクリーンショットを撮るケースに見える。これは当然可能で、権限もまったく不要。画面サイズのビットマップを作り、getWindow().getDecorView().draw(new Canvas(bitmap)); を実行すればよい。多くのアプリに大量に組み込まれている第三者の広告/マーケティング/トラッキング SDK がこうしたことをできる、というのはありそうな話
    • 引用されている研究をたどってみると、「カメラやオーディオ API と違い、スクリーンショットと画面録画 API はいかなる権限でも保護されていない」と書かれている
      ただし、17,260個のアプリのうち9,100個について静的解析を行い、「メディア API が実際のアプリコードから参照されているか」などを判断し、その後、動的解析でアプリが実際に API を呼び出すか確認したとのこと。つまり、ライブラリにリンクされているだけでアプリが呼び出していない場合とは区別したということ。記事の要約はよくない。「スクリーンショットを撮る潜在的な権限があった」ではなく、「スクリーンショットを撮る潜在能力があった」と言うべき
    • 「開発者にひそかにスクリーンショットを送る能力」という特定の権限があるとは思えない
      ネットワーク接続権限と、ユーザーに明確に見えない形で画面をキャプチャする権限のような、複数の権限の組み合わせである可能性が高い
    • 開発者向けツールの場合、これは RUM、つまりリアルユーザーモニタリングと呼ばれる
      バグ解決には非常に有用だが、濫用されたりユーザーに敵対的な形で使われたりする可能性も非常に高い
    • 権限という観点では、スマートフォンは権限が実際にいつ、どれくらい頻繁に使われたのかについての使用履歴を提供すべき
  • 人々は、スマートフォンが24時間聞いているという主張について、コストと精度を無視しているように思う。少なくとも現在の制約下では、こうしたことが起きる可能性は非常に低い
    音声の文字起こしは無料ではなく、計算コストが大きい。広告ネットワークや大規模サービスにとって、特にユニットエコノミクスを気にする組織では負担しにくい。精度もひどいものになるはず。ほとんどのスマートフォンはポケットの中にあり、ほとんど何も拾えない。さらに、普通の会話には広告主にとって価値のある内容がまれな一方、Google は購買意図のある検索で大きく稼いでいる。日常会話の信号対雑音比ははるかに低く、ユニットエコノミクスはさらに悪くなる。また、こうしたことが起きていれば気づきにくいはずもない。スマートフォンは熱くなり、バッテリーは早く減り、データも大量に使うはず。iOS ではマイク使用表示が見え、バックグラウンドでリソースを使いすぎれば OS がアプリを終了させる可能性が高い。実例が見つかるまでは心配する価値はない

    • こうした理由から、音声盗聴は電源につながっていて固定されており、RAM と普段は遊んでいる処理能力がそれなりにあるデバイスのほうがもっともらしい
      文字起こしモデルをローカルで動かして結果のテキストだけ送ればよく、電力もかなり使い、インターネットも任意のタイミングで使うのが自然なデバイス、たとえばスマート TVのようなもの
    • 常に聞く必要はない。置いた直後やロックボタンを押した直後に数語だけ拾えばよい。あるいは使用中だけ聞いてもよい
      ワードクラウドを作るのは些細なことで、バッテリーへの影響も最小限だろう
    • これらの点は記事でも、音声録音が広告主の持つ他の追跡メカニズムより有用性が低い理由として扱われていた
    • 音声録音が実際に行われているとは思わないが、経済性の論理は完全ではない
      「高価値」の対象、つまり物をたくさん買う人たちの音声だけを録音するとしたらどうか。彼らにだけ録音する価値があるかもしれず、だから通常の新しくクリーンなスマートフォンで行うランダムテストでは録音イベントを検出できないのかもしれない
  • スマートフォンではなく TV だが、昨日の YouTube は少なくともかなり怪しかった
    まず、視聴履歴をオフにしていても、同じ IP からアクセスした別アカウントの履歴をおすすめに利用していることはかなり明らかだった。履歴がなければホームのおすすめはオフになるが、検索を実行すると、妻が別アカウントで見ていたロッククライミングチャンネルの完全に無関係な動画が出てきた。私はこのアカウントでロッククライミングのコンテンツを見たことがない。二つ目は「聞いている」というほうだった。四半期ごとの害虫駆除に来た業者に、昨年末、手に負えない坂をスケートボードで下っていて転んだときにできた傷跡を見せながら話したのだが、5分もしないうちに TV をつけて YouTube を開くと、妻のアカウントの最初のおすすめが、時速50マイルでロングボードに乗って転ぶ動画だった。私たち二人ともスケートをし、このアカウントでダウンヒル動画をよく見ていることは秘密ではないが、事故動画は検索したことも見たことも、おすすめされたこともなかったのに、その TV の前で話してから5分でおすすめされた

  • でたらめだ。自分で試したことがあり、今でも通用する簡単な実験がある
    以前、英国の YouTube では耳垢除去の広告が本当にひどいほど大量に出ていた。実験兼いたずらとして、親しい友人二人にその広告がどれほど気持ち悪く食欲を失わせるかを話した後、わざと “ear wax removal” を何度も大声で繰り返した。案の定、1日後に友人から「お前マジで嫌い」みたいなメッセージが来た。友人たちのスマートフォンは Android と iOS で、被害を受けたのは Android ユーザーだったと思う

    • その広告の出どころがそれなら、本人はなぜその広告を見たのか? 自分のスマートフォンに耳垢除去と叫んでいたのか?
      スマートフォン上で動く広告ソフトウェアがプロフィールを結び付け、友人に「感染」を広げる方法は無数にある。基本的な位置情報アクセスが最も重要で、同じ IP アドレス(友人の WiFi?)、同じ Bluetooth ビーコンの近く、同じ保存済み SSID、あるいは友人が幅広い人口統計ターゲティング広告をたまたま見たことなどのほうが、「スマートフォンが24時間聞いている」よりはるかにありそう
    • 「自分のスマートフォンは聞いているし証明できる」という言葉は、批判的思考の不足を見分ける優れた目印
      自分のコメント内のバイアスと誤りが見えないのか?
    • あるいは、そのひどい広告の話を聞いた友人が何気なく検索し、それでリターゲティングリストに入った可能性もある
    • 本人と友人たちがそもそもその広告を見たのは、全員がその広告のターゲットだったから。単なる人口統計ターゲティングだったのだろう
      4週間のキャンペーンの1週目には全員無視していたが、4週目ごろにはあまりに何度も見たため頭に焼き付いた可能性が高い
  • 相関関係を作っているのは人間ですらない。Transformer がトークン予測だけで人間の知識の大半を学習できるように、広告配信用の機械学習システムも、人間について同じくらい詳細に学習していても驚きではない
    10年ほど前の最先端は、ユーザープロフィール、現在のウェブサイト、キーワードといった利用可能な文脈からクリック率をフォーナインの精度で予測することだったし、これは人間行動についてかなり正確な学習モデルが必要だと解釈していた。業界を離れたので現在の広告技術の最先端は知らないが、さらに進歩しているはず。モデルは直近の実クリック率に基づく自動ラベルデータ(秒間GB規模)で学習され、学習データ量は小さめの大規模言語モデルとおおむね同程度だった。最近の逸話として、3人が携帯電話を出したまま食卓に座り、珍しい鳥の話題について話していたところ、まもなくそのうち1人の Facebook 広告フィードにそれが表示された。考えられる説明としては、多くのアプリがサードパーティのデータ収集・広告ライブラリを大量にリンクしており、そのどれかが十分な文脈データを収集・再販売して相関関係を作れること、また別の友人たちが最近その話題について話していて、ソーシャルネットワーク上のつながりから、私たちもそれを知っているはずだと推論された可能性があること。かなり遠い第3の可能性は、人が話すときに身ぶりで手を振るなど、加速度計のような奇妙なサイドチャネルから音声を推論できるほどモデルが良くなっていること。加速度計のサンプリング速度は1KHz未満だが100Hzは超えるので、巨大モデルを投入すれば十分かもしれない

    • 「珍しい鳥の話題」について明示的な反証を提示していないので、本人が想像して議論できたどんな「珍しい鳥の話題」でも、スマートフォンが依存関係の連鎖の真ん中にあっただろうと、フォーナインの精度で予測しておく
    • 「クリック率予測のフォーナイン精度」が何を意味するのか理解しにくい
      広告1,000,000インプレッションのクリック率が24.5898%で、機械学習が25.1926%と予測したなら、これはナインいくつの精度なのか?
  • 以前の会社で、アプリ開発者が自分のアプリに組み込む、かなり人気のあるモバイルアプリ SDK を作っていた
    ある会社が接触してきて、MIT か Bell Labs で開発されたものだったと思うが、Shazam に似ているものの桁違いに効率的な音声認識技術があると主張した。ユーザーがテレビやラジオ広告に接触したかを認識して記録する追跡用途だと言い、彼らの SDK を私たちの SDK の中にこっそり同梱する見返りに収益分配を提案してきた。少なくとも10年前、Apple がマイクへのアクセス権限やオレンジ色の点表示を強制する前のことなので、名前は覚えていない。もちろん断ったので、それ以上のことは知らないし真偽もテストしていないが、本当に悪質な会社は存在する。最近のスマートフォンは端末内で音声処理をするのに十分な性能があるため、ネットワークトラフィックに現れるはずだという主張は成り立たない