埋め込み(エンベディング)
定義
埋め込みとは、テキスト(あるいは画像やコードなど)を意味を捉えた数値ベクトルとして表現したものです。意味の近いコンテンツ同士が、高次元の空間で近くに配置されます。
仕組み
埋め込みモデルは、テキストのかたまりを数値の並び、つまり数百から数千の次元を持つベクトルに変換します。モデルは、意味の近いテキスト(「パスワードを再設定したい」と「ログインを忘れてしまった」)が互いに近いベクトルになり、無関係なテキストは遠くに配置されるように学習されています。
近さはコサイン類似度などの類似度指標で測ります。これが、埋め込みが セマンティック検索や RAG、クラスタリングの土台になっている理由です。キーワードを照合するのではなく、意味を比べられるからです。
サポートで重要な理由
お客様の言い回しが自社のドキュメントと一致していなくても、AI サポートエージェントが正しいヘルプセンター記事を見つけられるのは埋め込みのおかげです。ナレッジソースを接続すると、通常は埋め込みに変換して ベクトルデータベースに保存されるため、エージェントは回答の根拠として最も関連の高い箇所を取り出せます。
よくある質問
埋め込みとトークンはどう違いますか?
トークンはモデルが読む小さなテキストの単位です。埋め込みは、トークン、フレーズ、ドキュメントの意味を表す数値ベクトルです。まずトークン化が行われ、埋め込みがそのトークンを意味を帯びたベクトルに変えます。
サポート AI で埋め込みが使われるのはなぜですか?
完全一致のキーワードではなく意味によって、お客様の質問と関連するナレッジを結びつけられるからです。これがセマンティック検索と検索拡張生成を支えています。
関連用語
ベクトルデータベース
ベクトルデータベースとは、埋め込み(高次元のベクトル)を保存し、類似度で検索するために作られたデータベースです。クエリに意味が最も近いコンテンツを高速に見つけられます。.
セマンティック検索
セマンティック検索とは、キーワードの一致ではなく意味によってコンテンツを探す検索手法です。エンベディングを使うことで、クエリと共通する語が 1 つもなくても、概念的に関連する結果を見つけられます。.
検索拡張生成(RAG)
検索拡張生成(RAG)とは、AI モデルが問い合わせの時点で自社のナレッジソースから関連情報を取得し、それに基づいて回答を組み立てる手法です。学習時に記憶した内容だけに頼らずに済みます。.
大規模言語モデル(LLM)
大規模言語モデル(LLM)とは、膨大なテキストで学習し、言語を予測・生成するニューラルネットワークです。質問の理解、要約、分類、人間らしい文章の作成といった処理を可能にします。.
Transformer モデル
Transformer モデルとは、アテンション機構を使ってテキストの系列全体を一度に処理し、各単語が他のすべての単語とどれだけ関係しているかを重み付けするニューラルネットワークのアーキテクチャです。現代のほぼすべての大規模言語モデルの土台になっています。.
アイデアを実装に
Macha は既に運用中のヘルプデスク (Zendesk、Freshdesk、Front、Intercom、Gorgias) の上に載る AI エージェント層です。
トライアルを開始