最終更新日:2026年9月23日
gk nlp transformer generative_ai
まず結論
LLM(Large Language Model:大規模言語モデル)は、大量のテキストなどを使って事前学習し、言語のパターンや文脈を扱えるようにした大規模な言語モデルです。
G検定では、LLMそのものを特定の1つの構造名だと思わないことが重要です。
- Transformer:ニューラルネットワークの構造
- GPT:Transformerを利用する代表的なモデル系列
- LLM:大規模に学習された言語モデルの総称
現代のLLMではTransformer系の構造が広く使われていますが、「Transformer=LLM」「GPT=LLMそのもの」ではありません。
また、現代の代表的なLLMは、広く事前学習して多様なタスクへ適応できる基盤モデル(Foundation Model)として利用されることが多いです。LLMと基盤モデルは重なりますが、LLMは言語に注目した呼び方、基盤モデルは多様な用途の土台になる役割に注目した呼び方です。
直感的な説明
LLMは、非常に大量の文章を読んで、
この文脈なら、次にどんなトークンが現れやすいか
といった言語のパターンを学んだモデルだと考えると分かりやすいです。
たとえば、
「今日は天気がよいので、」
という入力に対して、その続きとして自然なトークンの確率を計算し、文章を生成していきます。
ただし、LLMは文章をデータベースからそのまま検索して返しているわけではありません。学習したパターンにもとづいて出力を生成するため、もっともらしい誤りを出すことがあります。
定義・仕組み
言語モデルとは
言語モデルは、トークンの並びに対して、
- 次にどのトークンが現れやすいか
- 文中のトークンがどのような文脈で使われるか
など、言語の確率的な関係をモデル化します。
なぜ「Large」なのか
LLMでは、一般に次の要素を大規模化します。
- モデルのパラメータ
- 学習データ
- 学習に使う計算資源
ただし、
パラメータが何個以上なら必ずLLM
という世界共通の固定された境界があるわけではありません。
「大規模」という言葉は、モデルや学習データ、計算量などの規模を含む相対的な概念として捉えるのが安全です。
事前学習
LLMは、まず大量のデータを使って事前学習(Pre-training)します。
GPT系の代表的な事前学習では、過去のトークンから次のトークンを予測する自己回帰型の学習を行います。
一方、BERTでは、一部のトークンを隠して当てるMLMが代表的です。
つまり、すべての大規模言語モデルが同じ学習目的を使うわけではありません。
事前学習後の調整
事前学習したモデルは、そのまま利用するだけでなく、目的に応じて調整できます。
- ファインチューニング:追加データでモデルの重みを調整する
- Instruction Tuning:指示と応答の形式を学習させる
- RLHF:人間の選好を利用して応答を調整する
- プロンプト:重みを変えず、入力の与え方で出力を制御する
RLHFは代表的な調整方法の1つですが、すべてのLLMがRLHFを使うわけではありません。
いつ使う?(得意・不得意)
得意なこと
LLMは、言語を扱う幅広いタスクに利用できます。
- 文章生成
- 要約
- 翻訳
- 質問応答
- 分類
- コード生成・補完
事前学習した1つのモデルを、プロンプトや追加学習によって複数のタスクへ利用できる点が特徴です。
注意点
LLMの出力には次のような注意点があります。
- もっともらしい誤情報を生成することがある
- 学習データに含まれる偏りの影響を受けることがある
- 出力の根拠が自動的に保証されるわけではない
- 大規模な学習や推論には多くの計算資源が必要になる場合がある
したがって、文章が自然であることと、内容が事実として正しいことは別です。
G検定ひっかけポイント
LLM=Transformer?
❌ LLMはTransformerという層・構造そのもの
⭕ Transformerはモデル構造、LLMは大規模な言語モデルという分類
TransformerはLLMで広く使われる重要な構造ですが、両者は同義ではありません。
LLM=GPT?
❌ LLMという名前の1つのモデルがGPT
⭕ GPTはLLMの代表的なモデル系列の1つ
GPTでは、Decoder型Transformerと自己回帰型の次トークン予測を中心に整理しています。
LLMはすべて次トークン予測?
❌ すべてのLLMが同じ学習目的を使う
⭕ GPT系では次トークン予測が代表的だが、BERT系ではMLMなど別の学習目的もある
「LLM」と「GPT系モデル」を同一視しないことが重要です。
プロンプトで重みが更新される?
❌ プロンプトを入力するたびにモデルのパラメータが学習される
⭕ 通常のプロンプト入力は、学習済みの重みを変えずに推論する
重みそのものを更新するのは、ファインチューニングなどの学習です。
自然な文章=事実?
❌ 流暢に答えれば内容も必ず正しい
⭕ LLMはもっともらしい誤りを生成することがある
試験では、生成能力と事実性・信頼性を分けて考えます。
まとめ(試験直前用)
- LLM=大規模に学習された言語モデル
- Transformer=構造
- GPT=LLMの代表的なモデル系列
- GPT系では次トークン予測が代表的
- BERT系ではMLMなど別の学習目的もある
- プロンプト入力では通常、モデルの重みは更新しない
- 流暢な出力と事実の正しさは別
迷ったら、
構造の話? → Transformer
特定モデル系列? → GPT / BERT
大規模な言語モデル全体の話? → LLM
と切り分けます。