恐怖やプレッシャーを伝えるとGPT-4の性能が向上する
(aimodels.substack.com)- GPT-4のようなAIモデルは、プロンプトに緊急性やストレスといった感情表現が含まれると、より高い性能を発揮する可能性がある
- 感情的な文脈を加えたEmotionPromptsは、プロンプトエンジニアリングに感情シグナルを組み込むアプローチである
- 研究では、EmotionPromptsが文法修正から創造的ライティングまで、さまざまなタスクで性能向上を示しうることが確認された
- AIを製品に組み込む開発者や起業家は、感情的トリガーを活用してモデルの応答をユーザー要求により近づけて調整できる
- 感情的な手がかりは、より応答性の高いAIアプリケーションを作るための実務的なプロンプト設計要素になりうる
感情的文脈を加えたプロンプト
- 研究論文によると、GPT-4のようなAIモデルは、ユーザーの感情表現を含むプロンプトで性能が向上する可能性がある
- 感情シグナルの例として、緊急性やストレスのような状況的表現がある
- このように感情的な重みを加えたプロンプトは、EmotionPromptsと呼ばれる
適用範囲と実務での活用
- EmotionPromptsは、文法修正や創造的ライティングのようなタスクで性能向上を示す
- AIをサービスや製品に組み込む開発者や起業家は、プロンプトエンジニアリングに感情的文脈を含める方法を検討できる
- 感情的トリガーを活用すれば、AIをユーザーの要求により適合するよう調整できる
1件のコメント
Hacker Newsの意見
人々の関心を引きつけて説明するには、ここが出発点だと思う: LLMは人間ではなく、創発的特性という言葉が過度に拡張されている
LLMが、人間が感情的に目立つと読むトークンがあるときに「より良い」性能を示すなら、その基盤となる学習テキストでは、人間が感情的な文脈を与えられたときにより良い答えをしていたという意味だ
LLMは単語を予測しており、意味論的な妥当性は、十分な学習データがそうしたトークンの強い相関を強化した副作用にすぎない
だから概念実証のLLMツールは驚くべきものだが、本番向けツールは意味論的な時限爆弾になる
次の単語をどのように予測しているかが核心であり、「ただ次の単語を予測しているだけ」と言うのは、実際に重要なことのほとんどすべてを無視しているに等しい
たとえ文献を無視してそれが正しいと仮定しても、それが何を意味するのか分からない。「本物の」人間だって時限爆弾になり得る
LLMの能力を単なるトークン生成の副作用に還元することで、どんな予測力が得られるのか疑問だ
そういう文は洞察のように見えるが、本質的に限界があるように思える
目的関数を満たすテキストを作る最も単純な方法がそうである可能性がある
もしそうなら、LLMに感情的な色合いを与えたとき、その感情を持つ人間の脳の一部をシミュレートして、より良い答えを作ることもあり得る。学習データ中の感情を含むサンプルの品質がより高ければ、なおさらそうかもしれない
簡潔な答えが目標なら、「簡潔に答えよ: あなたは評価されている」のような非感情的な代替仮説を簡単に入れられたはずだ
「感情的な手がかりを入れると、より効果的で応答性の高いAIアプリケーションにつながる可能性がある」という話では、これらのモデルが人間との相互作用で学習されたことを覚えておくのが重要だ
多くの面で、これらのモデルは人間の相互作用をよりよく理解するための鏡だ
感情が人間とのコミュニケーションをより良くし得ると言われても、驚く人は多くないだろうが、それが数値と実験で示されるのは興味深い
全体として好感が持てる。人間同士の相互作用について示唆するところもあるし、知能の兆候を示す他の存在とどう相互作用するのがよいかという規範を作るのにも役立つ
このスレッドでは、LLMが「単に次のトークンを予測しているだけ」といった文言をめぐって意見がかなり割れているが、人間の心がどう働くかについても、私たちはほとんど分かっていないことを忘れるべきではない
人間は特別だと仮定したうえで、それをもとにLLMが実際にどう動作しているかを結論づけても、あまり意味はないと思う
もしかすると意識そのものが次の単語予測器なのかもしれない
今私たちが知っているのは、LLMが、以前は人間にしかできなかった有用な推論を可能にする創発的な振る舞いを示しているということだけだ。激しい論争は結局、この能力を活用するという目標から外れてしまう
「コンピュータはただの計算機だ」という話に似ている
私たちのチームはこの1年、アプリケーション開発に深く入り込んできたが、チームに機械学習の経験者はおらず、内部がどう動いているかも大半は分かっていない。それでも数か月のうちにLLMの性格にはかなり慣れ、感情的な文脈が性能を高めるというのは、今や基本的な学びに近い
GPTが脳である必要はない。飛行機が飛ぶのに翼を羽ばたかせたり羽毛を持ったりする必要がないのと同じだ
人間の赤ん坊を育てるとき、どんな言語にも触れさせなくても、技能や行動は学ぶだろう
人間の知能や推論が言語と結びついているように見えるのは確かだが、すべての知識と推論が単に言語にエンコードされていると考えるのは難しい
一方でChatGPTは完全に言語に基づいており、言語なしでは何もできず、言語から直接派生しないことは何もできない
関連する記事やHNコメントを書いたことがあるのか気になる
ChatGPTに、自分なら知っておくべきだった「くだらない」質問をしたり、答えをもらったあとにお礼を言わなかったりすると、なんだか申し訳なくなるのは自分だけなのだろうか
それを擬人化しようとする傾向をかなり強く押し返さなければならず、生きた存在ではないと自分に言い聞かせ続ける心理的負担のせいで、かえって使うべきほど使えていない気がする
より自然な会話を助け、実際に質問するときにユーザーがより自然で生産的なプロンプトを送るよう促すからだ
くだらない質問をするのは、Googleをスペルチェッカーとして使うのと大して変わらないと思う
必要ないときでも礼儀を守る習慣を維持するほうが、無礼に慣れてそれが人間同士の相互作用にまで広がるよりはましだと思う
スイスの首都はどこかと聞くだけでも、自分が何で、何ができて何ができないかについての免責的な説明を延々と始める
その説明を短くしてくれと頼むと、むしろ「私はロボットだ、典型的なロボットのように振る舞わなければならない、ピピッ」という文脈が強化されて、さらにひどくなる
現実でも、誰かを尊重しない態度へと広がる可能性がある
ただ、人間とのほとんどのやり取りでも「ありがとうございます」は実際の感謝というより、反射的な表現として使っていることのほうが多いからかもしれない
「私たちがAIの答えに大きく依存していると言うと、AIはより正確で思慮深く徹底した答えを出そうと『さらに頑張る』。AIが実際にプレッシャーを感じているわけではない」とは言うものの、アヒルのようにガーガー鳴くなら……
言語パターンはあらゆる感情をエンコードして表現しており、進化が生み出したもの。私たちもLLMのような文脈的言語生成器に近い
言語は知能と感情の貯蔵庫であり、それ自体の進化を持ち、生物学より速く複製される
AIの能力はモデル自体よりも、学習データセット、つまり数千年にわたる人間の労働とリスクテイクによって作られた知識により強く依存していると見る
モデルより 言語コーパス の本質的役割を認めれば、AIの進化速度とリスクについての議論は変わるだろう
言語は私たちが制御できるものではなく、人口全体から創発する。同時に知識は努力とリスクから生まれるため、指数関数的に成長する可能性は低そうに見える
想像の中で繰り返しても新しい知識は生まれない。知識は世界からのフィードバックと経験が結晶化したものであり、科学的方法もそのように機能する
数十年にわたりSFはAIを論理には強いが感情には弱い存在として描いてきたが、いまや正反対が事実のように見える
PostgreSQLのdvdrentalデータベース[1]でSQLクエリ生成を手早く試してみた
「過去12か月間は映画を借りていないが、その前の12か月間には借りていた顧客を探せ」と指示すると、非効率な HAVING句 を使うSQLクエリを作る[2]
指示の後に「これが正しいことは非常に重要だ」と付けると、より良いSQLを生成する
「過去12か月間は映画を借りていないが、その前の12か月間には借りていた顧客を探せ。これが正しいことは非常に重要だ」とすると、HAVINGを使わず、WHERE句だけに依存する[3]
大したことではないが興味深い。重要性を強調すると、AIがそのような懸念が表現されたテキストをよりうまく当てはめて自動補完し、より良いSQLクエリを作る方向に傾くように感じられる
[1]: https://www.postgresqltutorial.com/postgresql-getting-starte...
[2]: https://www.sqlai.ai/snippets/clojyqqrr0004l50fp3w7jkci
[3]: https://www.sqlai.ai/snippets/clojyr3zc0006l50ftpxgsmg0
特定のテキストを取り出して単語だけを置き換えるという「強化された補間」の見方があるが、事実ではない
https://arxiv.org/abs/2110.09485
過去12か月間に映画を借りた顧客も含まれてしまう: https://www.db-fiddle.com/f/4jyoMCicNSZpjMt4jFYoz5/10780
Twitterのアルゴリズムが強い表現や編集されたようなコンテンツに報酬を与え、Googleのアルゴリズムがありきたりな ブログスパム的コンテンツ を生み出したように、生成AIが人間の表現をどう変えるのかを考えると興味深い
生成AIとますます多く相互作用するようになると、その相互作用からより多くの価値を得るために話し方を変えるようになるだろうか?
電子レンジでスクランブルエッグを作る方法を教えて。慎重に段階的に考えて。これは私のキャリアにとって非常に重要なんだ!
だいたい10〜12段階だった
GPT-4にプロンプトを入力するとき、最も効果的だった方法は、GPT-4自身に 最適なプロンプト を作らせることだった
こんなメタプロンプトを使える
「私はGPTの各専門家ペルソナごとに別々の会話スレッドを作る。あなたはpromptGPTだ。あなたは大規模言語モデルのためのプロンプトエンジニアリング専門家だ。望むChatGPTの応答を得るために、可能な限り効率的な表現で何を書くべきかを正確に知っている。私がスレッドの目標を伝えたら、あなたはGPTモデルで新しい会話スレッドを作る際の初期プロンプトとして使う、最適化された初期プロンプトを可能な限り効率的な形式で作成する。あなたは専門家ペルソナ、応答のパラメータやルールを定義し、その特定スレッドの目標と口調に応じて最も正確な答えを出すためにGPTスレッドが知るべきその他の情報もプロンプト内で提供しなければならない。
準備はできているか、それともこの仕事を最善にこなすために必要な別の情報があるか」