Transformer モデル
定義
Transformer モデルとは、アテンション機構を使ってテキストの系列全体を一度に処理し、各単語が他のすべての単語とどれだけ関係しているかを重み付けするニューラルネットワークのアーキテクチャです。現代のほぼすべての大規模言語モデルの土台になっています。
仕組み
Transformer は 2017 年の論文「Attention Is All You Need」で登場しました。その核心は自己注意(セルフアテンション)です。各トークンについて、入力中の他のすべてのトークンがどれだけ関連しているかを計算するため、単語を厳密に 1 つずつ処理しなくても、代名詞がどの名詞を指しているかといった長距離の文脈を捉えられます。
テキストはまずトークンに分割され、数値ベクトル(埋め込み)に変換されます。積み重ねられたアテンション層がそのベクトルを変換し、モデルは次のトークンを予測します。アテンションは並列に計算できるため、Transformer は巨大なデータセットで効率よく学習できます。これが今日の大規模言語モデルを可能にしました。
サポートで重要な理由
目にする AI サポートエージェントのほぼすべてが、内部では Transformer の上に構築されています。このアーキテクチャを理解すると、その強みと限界の両方が説明できます。
- 会話全体を文脈として読む。単語を 1 つずつ読むわけではない
- コンテキストウィンドウが固定されているため、一度に考慮できる履歴の量に上限がある
- もっともらしいテキストを予測する仕組みなので、精度には自社データによる接地(RAG)が効く
よくある質問
大規模言語モデルにおける Transformer とは何ですか?
Transformer は土台となるニューラルネットワークのアーキテクチャです。大規模言語モデルは、膨大なテキストコーパスで言語を予測・生成するよう学習させた、非常に大きな Transformer です。
アテンション機構は何をしているのですか?
アテンションは、入力中の各単語が他のすべての単語にどれだけ関連しているかをモデルに重み付けさせます。これにより、単語を孤立して読むのではなく、長い文章にまたがる文脈と関係を理解できます。
関連用語
大規模言語モデル(LLM)
大規模言語モデル(LLM)とは、膨大なテキストで学習し、言語を予測・生成するニューラルネットワークです。質問の理解、要約、分類、人間らしい文章の作成といった処理を可能にします。.
埋め込み(エンベディング)
埋め込みとは、テキスト(あるいは画像やコードなど)を意味を捉えた数値ベクトルとして表現したものです。意味の近いコンテンツ同士が、高次元の空間で近くに配置されます。.
コンテキストウィンドウ
コンテキストウィンドウとは、言語モデルが一度に考慮できるテキストの最大量のことで、トークン数で測られます。与える入力と、モデルが生成する出力の両方が含まれます。.
トークン(LLM)
トークンとは、言語モデルが読み書きする単位となる小さなテキストのかたまりです。単語、単語の一部、文字などにあたり、入力量・出力量・コンテキストの上限、そして多くの場合は課金も、このトークンで測られます。.
基盤モデル
基盤モデルとは、広範な汎用データを大規模に学習させた大型の AI モデルで、ひとつの狭い用途のために作られるのではなく、プロンプト、検索、ファインチューニングを通じて多様な下流タスクに適応できるものです。.
アイデアを実装に
Macha は既に運用中のヘルプデスク (Zendesk、Freshdesk、Front、Intercom、Gorgias) の上に載る AI エージェント層です。
トライアルを開始