AIの基礎

生成AIとは?回答の仕組みとハルシネーションを理解して活用する

生成AIが文章や画像などの新しい出力を作る仕組みと、テキスト生成AIが与えられた文脈をもとに次のトークンをつなげて回答を作る基本原理を学びます。自然な文章と事実の正確さは別であるため、簡単な実習を通して確定情報と未定情報を分け、結果を自分で確認する方法も身につけます。

目次を表示

対象読者生成AIを初めて使う人や、回答がどのように作られ、なぜ誤りが生じるのかを基礎から理解したい一般ユーザー

準備するもの
  • テキスト型AIと簡単な会話ができること
  • AIの回答を常に事実として受け取らず、原文や計算と比較すること
  • 個人を特定できる情報や実際の顧客データではなく、架空の例で練習すること

01生成AIは何を作るのか

生成AIとは、ユーザーの依頼や入力をもとに、文章、画像、音声、コードなどの新しい形式の出力を作るAIを指します。この記事ではその中でも、会話型サービスで文章を生成するテキスト生成モデル、特に大規模言語モデル(LLM)の基本原理に範囲を絞ります。

生成AIが自然な文章を作れるからといって、人間と同じように理解したり意識的に判断したりしていると断定することはできません。また、すべての回答が正確で、常に最新情報を反映しているわけでもありません。まずは「自然に書く能力」と「事実を正しく述べる能力」を分けて考えることが重要です。

02トークンと文脈から回答が続いていく仕組み

テキスト生成モデルは、文章を内部でトークンという単位に分けて扱います。トークンは1つの単語の場合もあれば、単語の一部、記号などのより小さな単位の場合もあり、どのように分割されるかは言語やモデルによって異なります。

多くのテキスト生成LLMは、それまでに与えられた文脈をもとに次に来るトークンの可能性を計算し、その処理を繰り返して回答を続けます。このとき、毎回必ず最も確率の高いトークン1つだけを選ぶとは限らず、生成方法や設定によって結果が変わることがあります。Transformer系モデルでは、文脈内の要素同士の関係を反映するためにattentionという仕組みが使われます。

また、モデルを学習させる過程と、ユーザーの質問に対して回答を生成する過程は区別する必要があります。回答するたびに、すべての会話が即座に新しい学習データになると考えるべきではありません。また、すべての文章について毎回リアルタイムでWeb検索したり、データベースから文章をそのままコピーしたりして答えているわけでもありません。検索や計算機能が提供される場合、それらは基本的な言語生成とは別のツールとして接続されることがあります。

03自然な回答でも間違うことがある理由

言語モデルは自然につながる表現を作るのが得意でも、自然さと事実の正確さは同じ基準ではありません。もっともらしいものの事実とは異なる内容を作る現象は、一般にハルシネーションやconfabulationと呼ばれます。たとえば、実際には存在しない本、論文、リンク、統計、人物の発言などを、それらしい形式で示すことがあります。

そのため、出典が必要な質問では、タイトル、著者、日付、リンクなどを実際の原文と照合する必要があります。計算でも同じです。検索ツールや計算ツールが接続されていても、自動的に結果が完全になるわけではないため、重要な数値や出典は利用者自身が再確認する必要があります。

  • 文章が自然だからという理由だけで事実だと判断しない
  • 出典が示されたら、実在するか、内容が主張と一致するか確認する
  • 重要な数値や計算は可能であれば独立して再計算する
  • 最新性が重要な場合は、情報がいつのものか確認する

04小さな例で実際に依頼して確認する

以下は実際のサービス利用記録ではなく、編集用の実習です。架空の図書館のお知らせで、確定している情報は「土曜日14時の読書会」「定員8名」、申込方法はまだ未定とします。目的は単に短く要約することではなく、確定している事実と未定情報を分けることです。

プロンプト
次の架空の図書館のお知らせを2文以内で要約し、その下に「確定している情報」と「未定情報」を分けて書いてください。
確定している情報:土曜日14時の読書会、定員8名。
未定情報:申込方法。
提供されていない申込URL、電話番号、締切日は推測しないでください。
確認項目正しい基準
曜日と時間土曜日14時をそのまま維持
定員8名のまま維持
申込方法未定と表示
申込URL推測したり新しく作ったりしない
電話番号・締切日与えられていないため追加しない

AIが「オンライン申込」、任意のURL、電話番号など原文にない情報を追加した場合は、削除するか「要確認」と表示します。要約は短くする作業ですが、短くなっただけで正確な要約になるわけではありません。

05原理を理解した後、何に活用できるか

基本原理を理解したら、次は実際の成果物を作ってみます。同じ生成AIでも、目的によって依頼方法と確認基準は変わります。

気になる質問作る成果物確認基準
どう質問すれば欲しい答えを得られる?目的・状況・条件・形式を含む依頼文与えた事実と条件が結果でも維持されているか確認
AIで一人で勉強するとき、正解を見るだけにしない方法は?ヒントと誤答復習を含む練習会話AIがすぐに正解を代わりに出さず、計算や原理を自分で確認できるか確認
自分の時間に合う計画も作れる?曜日ごとの制限を反映した週間計画合計時間、1日の最大時間、作業回数を再計算
長い文章を要約すると重要な内容が抜けない?原文を圧縮した要約重要な事実、数値、条件が原文と一致するか比較

この4つは、それぞれ依頼文作成、学習練習、予定の意思決定、文書要約と、作る成果物が異なります。そのため「AIへの質問の仕方」だけを覚えるより、成果物ごとに適した確認基準まで一緒に身につけることが重要です。

自分で確認する項目

概念説明と編集用実習・実際のAI回答は異なる場合があります

  • 生成AI全般と、この記事で扱うテキストLLMの範囲を区別して説明しているか確認
  • トークンが単語や単語の一部などになり、言語やモデルによって異なる可能性があると説明しているか確認
  • 多くのLLMが文脈をもとに次のトークンを続けて生成する一方、常に最高確率の1つだけを選ぶと断定していないか確認
  • 学習過程と回答生成過程を区別しているか確認
  • リアルタイムWeb検索やデータベースからのコピーをすべての回答の基本原理として説明していないか確認
  • ハルシネーション、事実性、別の検索・計算ツールでも検証が必要なことを説明しているか確認
  • 実習で土曜日14時、定員8名、申込方法未定という事実を維持しているか確認
  • 申込URL、電話番号、締切日を推測しない基準が含まれているか確認
検証範囲の限界

この記事は一般ユーザー向けに生成AIの基礎原理を説明するための編集用教育コンテンツであり、特定モデルの内部構造や動作のすべてを説明するものではありません。実際のAI回答、トークン分割、生成方法、検索・計算機能はモデルやサービスによって異なるため、重要な事実、出典、計算は利用者自身が確認する必要があります。

参考資料と関連資料

次は何に活用してみますか?

気になる質問を選んで、実際の成果物を作ってみましょう。