一文による定義
テキスト埋め込みは、システムが類似検索、クラスタリング、または取得のために学習されたパターンを比較できるようにする数値ベクトルである [1][2]。
クイックアンサー
この記事は主に検索や検索増強生成に使用されるテキスト埋め込みに焦点を当てています。テキスト埋め込みは、単語、文、段落、またはドキュメントのチャンクを数値のリストに変換します。このリストはしばしばベクトルと呼ばれます。ベクトルが近いテキストは、埋め込みモデルでは類似すると見なされます。
ベクトルの近接度は、タスクのために学習されたパターンを示していますが、真実、アイデンティティ、意図、または事実の等価性の証拠ではありません。2つの文章が関連する語彙を使用している、同じトピックを扱っている、または学習された意味的なパターンに適合しているため、近接している可能性があります。これは、1つの文章がもう1つの文章を証明している、両方が正確である、またはシステムがユーザーの目的を完全に理解していることを意味するものではありません。
なぜ重要なのか
埋め込みは、現代のAIツールが単なる正確な単語ではなく、意味で検索できる理由の1つです。ユーザーが「失敗したアクティベーション後の返金」を尋ねた場合、キーワードシステムはその単語のみを検索します。埋め込みベースの検索システムは、モデルがこれらのアイデアを近くに配置している場合、返金に関する記述、ライセンスエラー、アクティベーションの失敗、またはサポートの例外に関する記述も見つける可能性があります。
これはRAGシステム、知識ベース検索、重複検出、クラスタリング、推薦、意味的検索に役立ちます。Sentence-BERTは、コサイン類似度で比較できる文の埋め込みを作成する影響力のある方法を示し、これは以前のBERTスタイルの方法で1つずつ文ペアを比較するよりも、類似性検索とクラスタリングをより実用的にしています[1]。
しかし、埋め込みは魔法の意味ではありません。MTEBは、テキスト埋め込みが多くのタスク、データセット、言語で広範囲に評価される必要があるため作成されました。その著者たちは、どの手法もすべてのタスクで優位に立つことはないと発見しました[2]。これは構築者にとって実践的な教訓です。つまり、モデルが「最適」であるという一般的な主張ではなく、実際の仕事に適した埋め込みを選択し、テストする必要があります。
仕組み
一般的なテキスト埋め込みワークフローには4つのステップがあります。まず、ソース資料を段落、セクション、またはレコードなどのチャンクに分割します。次に、各チャンクを埋め込みモデルに送信し、ベクトルを返します。3番目に、ドキュメントのメタデータとともに、ベクトルを検索インデックスやベクトルデータベースに保存します。4番目に、ユーザーが質問をしたときに、質問を埋め込み、近くのベクトルを検索します。
取得されたチャンクは、検索結果として直接表示されるか、RAGシステムにコンテキストとして渡されます。言語モデルはこれらのチャンクを使用して答えをドラフト化するかもしれません。埋め込みは答えを書くものではなく、どの資料が関連性がある可能性が高いかを決定するのを助けます。
類似度は通常数学的に測定され、コサイン類似度や関連する距離測定が使われます。そのスコアは候補者をランク付けするのに役立ちますが、校正された真実スコアではありません。高い類似度のセグメントでも、古く、不完全、許可されていない、または正確な質問とやや関係があるだけである可能性があります。
エンドツーエンドの例
2,000ページのポリシーおよびトラブルシューティングページを持つヘルプセンターを持つ会社を想像してください。チームは各ページをセクションに分割し、各セクションを埋め込み、製品、地域、日付、アクセスレベルなどのメタデータとともにベクトルを保存します。ユーザーが「トライアル終了後にアクティベーションに失敗した場合、返金は可能ですか?」と尋ねます。
システムは質問を埋め込み、近くのチャンクを検索します。返金ポリシーのセクション、アクティベーションのトラブルシューティングノート、および地域の例外ページを取得する可能性があります。良いインターフェースはこれらのセクションと日付を表示するべきです。RAGアシスタントが答えをドラフト化した場合、ユーザーは取得されたセクションが実際に主張を支持しているか、ポリシーが最新か、顧客がその情報を見ることができるかを確認する必要があります。
一般的な誤解
最大の誤解は、埋め込みの類似性が事実上の等価性を意味すると考えることです。そうではありません。「サブスクリプションをキャンセルする方法」と「サブスクリプションを一時停止する方法」はベクトル空間で近いかもしれませんが、それぞれ異なるポリシーの答えを持つ可能性があります。「返金が拒否された」と「返金が承認された」は多くの単語を共有しているかもしれませんが、意味は正反対です。
もう一つの誤解は、埋め込み(embeddings)により検索設計の必要性がなくなるということです。チャンクサイズ、メタデータフィルター、アクセスルール、クエリの再書き換え、再ランク付け、新鮮さ、および評価はすべて結果に影響を与えます。弱い検索設定は、埋め込みモデル自体が合理的であっても、言語モデルに誤った証拠を与える可能性があります。
リスクと制限
埋め込みシステムは、裏付けのない材料を検索できる可能性があります。まれな例外を見逃す、近隣のトピックを混乱させる、学習された表現に隠れたバイアスを隠す、または言語やドメインごとに不均一に動作する可能性があります。ALIGN-SIMは、研究された文エンコーダーがすべてのテストされた意味的類似性基準と一致しないことを発見しました。これは、一部のベンチマークで優れたパフォーマンスを示したとしてもです[3]。これは、あなたが必要な行動を評価するのではなく、あなたが好きなベンチマークの数値だけを評価するという慎重なルールを支持しています。
セキュリティとプライバシーも重要です。プライベートドキュメントから埋め込みが作成される場合、検索システムは取得されたチャンクを表示または使用する前にアクセス権を強制する必要があります。ベクトル自体はアクセス権の境界ではありません。不適切なインデックス作成、メタデータのミス、ログ、または承認されていないドキュメントから生成された回答によって、機密データがさらされる可能性があります。
実践的な判断チェックリスト
埋め込みベースの結果を信頼する前に、次の質問をしてください。何が埋め込まれましたか?どのようにチャンク化されましたか?使用されたメタデータフィルターはどのようなものですか?検索されたセクションは最新で承認されていますか?セクションは正確な主張をサポートしていますか?隣接するセクションが逆の意味を持つ可能性はありますか?このシステムは実際のユーザーの質問や既知の失敗ケースでテストされましたか?
低リスクの発見には、埋め込み(embeddings)が検索をより寛容で役立たせることがあります。法的、医療、金融、雇用、顧客、またはセキュリティの決定には、埋め込みを検索のサポートとしてのみ使用してください。最終的な答えには、ソースの検証、アクセス制御、および高リスクの使用では人間の所有者が必要です。