コンテキストウィンドウ
定義
コンテキストウィンドウとは、言語モデルが一度に考慮できるテキストの最大量のことで、トークン数で測られます。与える入力と、モデルが生成する出力の両方が含まれます。
仕組み
1 回のリクエストでモデルが「見る」ものは、システムプロンプト、会話履歴、検索で取得したドキュメント、そして今まさに書いている返信まで、すべてコンテキストウィンドウに収まらなければなりません。単位は トークンです。上限を超えると古い内容から切り詰められるか捨てられるため、モデルは実質的に会話の最初のほうを忘れます。
ウィンドウの大きさはモデルによって異なり、数千トークンのものから 100 万トークンを大きく超えるものまであります。ウィンドウが大きいほど、より多くの履歴やドキュメントをまとめて推論できますが、扱うトークンが増えればコストも上がり、応答が遅くなることもあります。
サポートで重要な理由
コンテキストウィンドウは、長いチケットのやり取り、ナレッジベース、顧客履歴のうち、エージェントが一度に把握できる量の実質的な上限を決めます。RAG(検索拡張生成)が存在する中心的な理由もここにあります。ナレッジベース全体をウィンドウに詰め込むのではなく、関連する箇所だけを取り出して収めることで、回答の根拠を保ちながらコストも抑えられます。
よくある質問
コンテキストウィンドウを超えるとどうなりますか?
上限を超えた内容は切り詰められるか捨てられるため、モデルは会話やドキュメントの前半を失うことがあります。検索や要約といった手法を使えば、本当に関連する部分だけをウィンドウ内に残せます。
コンテキストウィンドウは大きいほど良いのですか?
必ずしもそうとは限りません。ウィンドウが大きければ一度に扱える履歴は増えますが、トークンが増えるぶんコストと遅延も増えます。非常に長いコンテキストの中に埋もれた細部をモデルが見落とすこともあります。単にテキストを詰め込むより、適切な検索のほうが良い結果になることが多いのです。
関連用語
トークン(LLM)
トークンとは、言語モデルが読み書きする単位となる小さなテキストのかたまりです。単語、単語の一部、文字などにあたり、入力量・出力量・コンテキストの上限、そして多くの場合は課金も、このトークンで測られます。.
大規模言語モデル(LLM)
大規模言語モデル(LLM)とは、膨大なテキストで学習し、言語を予測・生成するニューラルネットワークです。質問の理解、要約、分類、人間らしい文章の作成といった処理を可能にします。.
検索拡張生成(RAG)
検索拡張生成(RAG)とは、AI モデルが問い合わせの時点で自社のナレッジソースから関連情報を取得し、それに基づいて回答を組み立てる手法です。学習時に記憶した内容だけに頼らずに済みます。.
エージェントメモリ
エージェントメモリとは、AI エージェントが会話の中で、あるいはセッションをまたいで情報を保持し、思い出す能力のことです。過去のメッセージ、顧客の情報、これまでのやり取りを覚えているため、毎回のやり取りをまっさらな状態として扱わずに済み、一貫した対応ができます。.
Transformer モデル
Transformer モデルとは、アテンション機構を使ってテキストの系列全体を一度に処理し、各単語が他のすべての単語とどれだけ関係しているかを重み付けするニューラルネットワークのアーキテクチャです。現代のほぼすべての大規模言語モデルの土台になっています。.
アイデアを実装に
Macha は既に運用中のヘルプデスク (Zendesk、Freshdesk、Front、Intercom、Gorgias) の上に載る AI エージェント層です。
トライアルを開始