BrainGPT、思考をテキストに変換
(iflscience.com)- University of Technology Sydneyの研究チームは、EEG脳波だけで黙読している文章を画面上のテキストに変換する非侵襲型のbrain-to-text技術を公開
- AIモデルDeWaveは脳インプラントやMRIなしで動作し、利用者は脳活動を記録するEEGキャップを装着
- EEGはインプラント由来の信号よりノイズが多いが、BLEU基準で約0.4を記録し、名詞より動詞のマッチングでより良い結果を示した
- 「the author」が「the man」に変わるような誤りが見られ、正確な単語より意味の近い単語を選んでしまう限界がある
- 研究チームは精度を0.9まで高められると見ており、結果はNeurIPSで公開されたが、ArXiVのプレプリントはまだ査読前
EEGだけで文章を読み取る実験
- University of Technology SydneyのGrapheneX-UTS Human-centric Artificial Intelligence Centreの研究チームは、生のEEG波形を直接言語へ変換する方式を実験
- Ching-Ten Linは、brain-to-text翻訳プロセスに**離散エンコーディング(discrete encoding)**手法を統合した初の事例だと説明
- 参加者はテキストの一節を黙読し、AIモデルDeWaveは脳波のみを入力として受け取り、単語を画面に表示
- この成果は、AIと機械学習研究者の年次学会であるNeurIPS conferenceでスポットライト論文に選ばれた
非侵襲方式の利点と現在の限界
- 既存のbrain signal-to-language技術と異なり、この方式は脳インプラントやMRI装置を必要としない
- eye-trackingソフトウェアのような追加入力なしでも利用可能
- 研究チームは、他の機器と組み合わせて使う方法も可能だと見ている
- 利用者はEEGで脳活動を記録するキャップを装着するだけでよい
- EEG信号はインプラントから得られる情報よりノイズが多い
- BLEUアルゴリズム基準のスコアは約0.4水準
- Yiqun Duanは、モデルが名詞より動詞のマッチングに優れていると説明
- 名詞では「the author」の代わりに「the man」のように、正確な翻訳より同義語や意味的に近い単語が出る傾向があった
- 研究チームは、脳が単語を処理する際に意味の近い単語が類似した脳波パターンを生み出す可能性があると見ている
- 今後の目標精度は0.9
- 0.9は従来の言語翻訳プログラムと比較可能な水準
- 実験参加者は29人で、複数の他のデコーディング技術の実験より一桁以上多いと評価されている
- 結果はNeurIPSで公開され、プレプリントはArXiVに掲載されている
- まだ査読を経ていない
1件のコメント
Hacker News の意見
脳コンピューターインターフェースで博士号を取り、EEG と埋め込み電極を扱ったことがある
BCI 研究のかなりの部分は、麻痺患者が再びコミュニケーションできるよう支援することに焦点を当てている
残念ながら EEG は、ファラデーケージのある実験室、数日・数週間にわたるノイズ除去、眼球運動アーティファクトの除去といった条件の外では、十分な 信号対雑音比を提供できず、良好なコミュニケーション速度を出すのは難しい
これは頭蓋骨の外に出てくる脳の電場が弱まるという物理的限界なので、克服は容易ではない。たとえば商用の「心を読む」おもちゃは、実際には頭部と眼筋の信号に基づいて動作している
埋め込み電極はより良い信号を与えるが、商業的に viable になるにはまだ何度も反復が必要だ。数か月経つと脳が電極の周囲に瘢痕組織を作って信号が劣化し、脳手術そのものも当然かなり危険だ
人間を対象にしたテストには政府の承認が必要なので、反復サイクルも非常に遅い。麻痺した友人が目だけを動かせるなら、私は間違いなく 視線追跡技術に注力する。私が聞いたことのあるあらゆる BCI を圧倒する
また記事にあるように、優れた AI アルゴリズムが多くのノイズをフィルタリングしたり解釈したりする助けになると見ているのかも気になる
たとえば金属探知機を通ったり、携帯電話に触れたりする場合だった
予想どおり、最大級のノイズ源の一つは、電源につないだ携帯電話に触れることだった
EEG 用のファラデービーニーのようなものは実際に機能しそうだし、補助的な一人称映像まで加えれば、医師が多くのノイズを取り除けそうだ
この論文自体はむしろ、アルゴリズムが良くなるにつれて EEG の信号対雑音比の問題が改善されうるという、かなり強い証拠のように見える
患者は脊椎側の神経が損傷していたケースだったと思う。有望な進展に見えたが、どう思うのか気になる
https://actu.epfl.ch/news/thought-controlled-walking-again-a...
キーボードのある部屋の音声から何をタイプしたかを復元するように、ディープラーニングがノイズの中から信号を再び引き出す能力を過小評価してはいけない
最大の課題は、信号と相関した EEG データを作るコストが相対的に高いことかもしれない。そのため、既知の対象を見たり処理したりしている人々の数百万時間分のデータをモデルに投入することは起こりにくい
一方で視線追跡データは、新しい消費者向けハードウェアの中核コンポーネントになりつつあり、まもなく爆発的に増えるだろう
正解: Bob attended the University of Texas at Austin where he graduated, Phi Beta Kappa with a Bachelor’s degree in Latin American Studies in 1973, taking only two and a half years to complete his work, and obtaining generally excel- lent grades
予測: was the University of California at Austin in where he studied in Beta Kappa in a degree of degree in history American Studies in 1975. and a one classes a half years to complete the degree. and was a excellent grades
わあ、これは70〜80年代の初歩的な 音声テキスト変換システムに似て見える。脳インターフェースは急速にSFの領域を離れて現実になりつつある。まだこれをどう受け止めればよいのかよく分からない
実際の結果は Table 3 にあり、はるかに悪い
つまり、TTS モデルがその人が「考えている」と信じるものに対するボトムアップ処理と、これまでの会話が与えられたときに文法モデルが平均的な人が「次に言う」と信じるものに対するトップダウン処理との間でバランスを取る方式だ。実際の新皮質のように
考えてみると、その人の文字起こしされた会話コーパスがあれば、LLM をそれに合わせて訓練することもできる。そうすれば「その人がこの時点で何を言うか」を予測する機能にほぼ正確に対応する
さらには AMPAR と NMDAR の作用の電気的結果を読み取れる EEG パッドの位置を追加で見つけられるかもしれない。これにより、その人が現在、自分の内部のトップダウン発話モデルにどれだけ依存しているのか、それとも以前に考えたことのない奇妙で新しい文を作ろうとして内部のボトムアップ処理を使っているのかを判別し、この情報を使って TTS モデルと LLM が出力に及ぼす影響の重みを調整できる
誰かが最大限監視する「無料」の BCI を出してくるに決まっている
https://www.youtube.com/watch?v=OSV7cxma6_s
「これらすべての技術が想像を絶する速度で進歩する中、注目すべき未来学者 Peter Diamandis があなたの思考を揺さぶり、健康寿命についての新たな可能性と機会を想像させてくれるだろう」
「脳信号を言語に翻訳できる初の技術ではないが、これまでに出てきたものの中で、脳インプラントも本格的なMRI装置へのアクセスも必要としない唯一の技術」というくだりがある
10〜20年後にセンサー技術が十分に進歩して、帽子をかぶる必要すらなくなったら、公共の場では思考を読まれないという合理的な期待はない、というようなことを言う人が出てくるのではないか気になる
監視技術は概して正常化される傾向があり、それがどこまで行き得るのか、現実的な限界があるのかも気になる
10年以上前に、Targetのロイヤルティプログラムのアルゴリズムが購入行動の変化の相関、たとえば香り付きキャンドルから無香料キャンドルに変えたことなどを見て、家族に話す前にある10代の少女の妊娠を見抜いたという話があった
ソーシャルメディア、CCTVの顔・視線追跡、携帯電話のジャイロスコープデータ、購買履歴、検索履歴、そしてつながっている知人たちの同種のデータを取得できるなら、十分に広い比較データセットによって、あらゆる隠された秘密を見つけ出せるだろう
「自分の携帯電話が会話を聞いている」という恐怖に似ている。実際には聞いていないが、本当に心配すべきなのは、そもそも盗み聞きしなくても、あなたが結局何を言うかをかなり正確に描き出せてしまうことだ
あまり大きな期待はしていない
これは非常に印象的で有用であると同時に恐ろしい
皆すぐに尋問用の心読みを思い浮かべたが、自己省察はどうだろうか? 私たちは完全に客観的な自己分析ができないからこそ、さまざまな形の教育や治療が存在している
頭の外で自分の思考パターンを分析できるなら、あらゆる改善が可能になるかもしれない。どの教育手法が実際に最も効果的なのかを見つけたり、いつ最も集中している/集中できていないのかを客観的に確認したり、不安な思考がいつ始まり、何が引き金になったのかも正確に突き止められる
何より、これを個人的に、パートナーと、あるいは集団の中で選択的に行える
また現在でも、fMRIを脳スキャン型の嘘発見器として使うことはできる。ただし、その正当性にはなお多くの疑問がある
https://scholarship.law.columbia.edu/cgi/viewcontent.cgi?art...
難しいのは自己省察そのものだけではなく、後で分析するには省察すべきことを覚えておき、出来事を書き留めておかなければならない点だ。正確性を信頼できるという前提があっての話だが
この問題の倫理的な穴が宇宙ほど大きいのに、すぐに利点の話へ移れることに驚く
とはいえ、それが技術楽観主義者の本性なのかもしれない
14年前のDARPAのSilent Talkを思い出す
目標は「神経信号の分析を通じて、戦場で発話された音声なしにユーザー間の通信を可能にすること」だった
https://www.engadget.com/2009-05-14-darpa-working-on-silent-...
これは非常に印象的で有用であると同時に恐ろしい
脳卒中患者の助けになりそうだが、同時にフィルタリングされていない思考を外に出してしまい、厄介なことになる可能性もあると想像する
Neuralinkがあれば問題ない。思考の痕跡をそのままアップロードすればいい
誤った思考があっても心配する必要はない。心の状態を変えてくれる更生学校がある
幸せでいなければならないことを忘れないように。悲しむことは禁止だ
今は読み取り専用だが、書き込みはどうだろう?
これは現実版Matrixのような新しい可能性も開き得る
ところでLightspeed Briefsって聞いたことある?
もちろん研究そのものは素晴らしく、有用なものになるだろう。ただし長期的には、政治的悪用の可能性がとてつもなく大きい
閉じ込め症候群の患者にとっては想像しがたいほどの前向きな恩恵だが、同時に「Torment Nexusを発明するのはもうやめて!」と思わせる話でもある
私が何か大きな点を見落としているのでなければ、被験者が単語を紙に書いておき、後で結果を比較するブラインド対照デモのほうが説得力があるはずです。
残念ながら、記事に出てきたデモはプロのマジシャンやメンタリストでもできそうに見えました。
脳インターフェイスに近づいているのは確かでしょうが、この事例はどこかおかしいです。
数年後に誰かが「邪悪な考え」を検知する空港スキャナーを発明したとしましょう。ところが検証する方法もなく、誤検知・見逃しへの責任もない。結果は運用者が言うとおりです。
十分な人々が抵抗しない程度に受け入れ、さらには検知された人々を攻撃するなら、何が本物かは重要ではありません。ただ人々が一緒に参加する共感呪術の儀式になるだけです。最近の記憶の中にも、似たような力学の例がある気がします。
非言語的思考も可能なのか気になります。
日常活動と結びついた信号データセットをもとに、犬が何を考えたり夢見たりしているのかを突き止めることもできるのではないでしょうか。
身体で経験する体験の表現を出力するのは、きちんと作って解釈するのが難しい課題になりそうです。ただ、身体経験と結びついた信号データセットは、視覚言語モデルを使って言語的な説明として、より簡単かつ堅牢にアノテーションできるかもしれません。
そうすれば、犬の心を読むモデルがその言語説明を予測して出力できます。
愛犬がどの公園に行きたいのか、病気やけがの微妙な初期兆候を感じているのか、どんなおやつを買ってほしいのかを具体的に分かる、と想像してみればよいです。
参考までに、この論文が使っている基盤モデルにはコードのバグがあり、ベースライン結果が水増しされていました。
現在、この問題を調査中です。
https://github.com/duanyiqun/DeWave/issues/1
恐ろしい含意はさておき、これはとてもすごいことを可能にします。双方向のテレパシー通信です。
メッセージを考えて「送信」を考えると、イヤーバッドで返信を聞く、という形です。音声クローンまで付ければ、送信者の声でメッセージを受け取ることもできます。
外部の観察者には完全に静かで、見えません。
このシステムのハードウェアを一種の変換器として使ってみる結果がとても気になります。つまり、ここでの機械学習モデルを目標テキストから逆方向に走らせ、出てきた下位の電気信号を経頭蓋直流刺激信号としてEEGパッド経由で再び押し込む方式です。
その結果、人がそのテキストを自分の心の中の声による言語的思考として「聞く」ようになるなら、本当に興味深いでしょう。
当時はGameBoy Colorが世界でいちばんクールな物でした。
PsOneのTomb Raiderは高解像度に見えたし、高解像度というもの自体が存在せず、ゲームの頂点に来ていると思っていました。
Apple Pro Oneはコンピューターを空間化しようとしていて、私たちはテレパシーをクールだと感じています。
森を走ったりスキューバダイビングをしたりしながら、10秒ずつ心だけでコーディングできたらいいですね。
他の人が心の中で作った絵を受け取って目の前に表示し、周りの人たちに「ねえ、Juliaが作ったものを見て」と共有できたらいいですね。
実のところ、これはすでに起きていることとまったく同じで、ただより即時的な方式になるだけです。スマートフォンを心に、画面を環境に置き換えれば、その未来世界に入っています。
新しさのせいでクールに見えるのだとしたら、またパンチカードでコードを打ったり、端末でedを使って行を書いたりするのもクールなのではないでしょうか。
数年前、DAWでの音楽制作から70〜84年製のシンセサイザー10台とテープマシンに移ったのですが、はるかにクールで、戻るつもりはありません。
でも、以前と同じくらい速く作れているか? いいえ。
私が心と仮想の浮遊スクリーンだけでコードを書きたい理由は、新しさがもたらす数日間のクールさを除けば、たった一つです。
もっと働きたくないから、より正確には職場にいる時間を減らしたいからです。
しかし実際には、もっと多くの仕事を作れと求められるでしょう。心の力だけで、周囲に仮想スクリーンを5〜6枚浮かべて働くことが必須になるでしょう。
そしてそれで全部です。また別の新しい発明がクールに見えるようになるまで。
たとえば侵入思考、頭の中でぐるぐる回る曲、秘密のようなものです。
この技術の意図しない結果は想像を超えるでしょう。