トークン(LLM)
定義
トークンとは、言語モデルが読み書きする単位となる小さなテキストのかたまりです。単語、単語の一部、文字などにあたり、入力量・出力量・コンテキストの上限、そして多くの場合は課金も、このトークンで測られます。
仕組み
モデルがテキストを処理する前に、トークナイザーがそれをトークンに分割します。よく使われる単語は 1 トークンになりますが、長い単語や珍しい単語は複数に分かれます(「tokenization」が「token」+「ization」になる、といった具合です)。英語の目安としては、1 トークンはおよそ 4 文字、単語のおよそ 4 分の 3 です。つまり 1,000 トークンで 750 語ほどになります。日本語は 1 文字あたりのトークン数が多くなるため、同じ内容でもトークン数は増えがちです。
モデルはトークンを入力として読み、トークンを出力として生成します。どちらもコンテキストウィンドウを消費し、ほとんどの LLM の API は入力と出力で別のレートを設けたトークン単位の課金を採用しています。
サポートで重要な理由
トークンは、LLM ベースのシステムにおけるコストと容量の単位です。長いチケットのスレッド、大きな参照ドキュメント、冗長なプロンプトはいずれもトークンを多く消費します。だからこそ、簡潔なプロンプトと的を絞った検索が、レイテンシと API コストの両方を抑えます。
よくある質問
1 トークンは何語ぶんですか?
英語では 1 トークンが平均しておよそ単語の 4 分の 3、文字数にして約 4 文字です。つまり 1,000 トークンで 750 語ほどですが、文章とトークナイザーによって変わります。日本語では 1 文字が 1 トークン前後になることが多く、同じ分量でも英語よりトークン数が増えます。
LLM はなぜトークン単位で課金されるのですか?
トークンはモデルが実際に処理する単位であり、リクエストが使う計算量を最も直接的に表すからです。プロバイダーは通常、入力トークンと出力トークンに別々のレートを設定しています。
関連用語
コンテキストウィンドウ
コンテキストウィンドウとは、言語モデルが一度に考慮できるテキストの最大量のことで、トークン数で測られます。与える入力と、モデルが生成する出力の両方が含まれます。.
大規模言語モデル(LLM)
大規模言語モデル(LLM)とは、膨大なテキストで学習し、言語を予測・生成するニューラルネットワークです。質問の理解、要約、分類、人間らしい文章の作成といった処理を可能にします。.
Transformer モデル
Transformer モデルとは、アテンション機構を使ってテキストの系列全体を一度に処理し、各単語が他のすべての単語とどれだけ関係しているかを重み付けするニューラルネットワークのアーキテクチャです。現代のほぼすべての大規模言語モデルの土台になっています。.
埋め込み(エンベディング)
埋め込みとは、テキスト(あるいは画像やコードなど)を意味を捉えた数値ベクトルとして表現したものです。意味の近いコンテンツ同士が、高次元の空間で近くに配置されます。.
Temperature(LLM)
Temperature(温度)は、言語モデルの出力をどれだけランダムにするか、決定的にするかを制御する設定です。値が低いと焦点の定まった予測可能な応答になり、高いとより多様で創造的な応答になります。.
アイデアを実装に
Macha は既に運用中のヘルプデスク (Zendesk、Freshdesk、Front、Intercom、Gorgias) の上に載る AI エージェント層です。
トライアルを開始