こんにちは。
最近、ブラウザで実行した操作を自動でユーザーマニュアル(SOP)に変換するChrome Extensionを作りました。
従来の画面録画方式とは異なり、クリックや入力イベントをDOMコンテキストとともに収集し、人が理解しやすい作業ステップとして再構成します。
現在のパイプラインは次のとおりです。
Browser Recording → DOM Context Extraction → Solar Pro 3 → AI Validation → Word / PDF / Markdown
実装しながら最も難しかった部分は、「どこまでを1つのStepとみなすか」でした。
ブラウザイベントをそのまま記録すると細かくなりすぎ、逆にまとめすぎると重要なユーザーの意図が失われます。現在は、DOMの変化、入力状態、ページ遷移などを基準にイベントを統合した後、Solar Pro 3が各段階を自然言語の説明として生成し、AIが順序と抜け漏れの有無をもう一度検証する方式で実装しています。
現在はドキュメントを生成する段階まで実装されており、次は生成されたマニュアルを構造化されたTask Planとして活用する方向を実験しています。目標は単なる文書ではなく、AI Agentが作業を理解して案内したり、反復的なブラウザ作業を再現できる実行可能なワークフローへ発展させることです。
まだInteraction SegmentationとTask Planningは継続的に改善中です。関連する研究や実装経験をお持ちの方のフィードバックを伺いたいです。
まだコメントはありません。