AIにおける幻覚とは?原因、リスク、解決策

AIにおける幻覚とは?

Scrapeless Scraping Browserは、応答に事実が必要な場合に証拠として使用できる現在のWebコンテンツをAIシステムに提供します。

TL;DR

  • AIの幻覚は、自信を持って出力されるが、信頼できる証拠に裏付けられていない、不正確、または矛盾した結果です。 言葉の表現は、基本的な主張が偽であっても洗練されて聞こえることがあります。
  • 幻覚はシステムの動作であり、モデルに意図や認識がある証拠ではありません。 言語モデルは、保証された事実の内部データベースを参照するのではなく、可能性のあるトークンシーケンスを生成します。
  • 基盤を持つことでリスクは低下しますが、真実を保証するものではありません。 取得されたパッセージは古く、無関係であるか、誤読されている可能性があるため、証拠の質と回答の検証は依然として重要です。
  • 検出は、主張をソースと照らし合わせてテストしなければなりません。 流暢さ、長さ、自信は弱い信号です。正しい回答と間違った回答が同じトーンを共有することがあります。
  • 重大な影響を与えるワークフローには、忌避とレビューのパスが必要です。 システムは、証拠がないときに言うべきであり、重要な決定を有資格者にルーティングすべきです。

AIにおける幻覚の定義

AIにおける幻覚は、信頼できる証拠によって裏付けられていないにもかかわらず、声明、引用、出来事、計算、または関係を真実として提示する生成されたコンテンツです。このエラーは、供給された文書に矛盾する場合があり、一般的に確立された事実から逸脱するか、どのソースにも含まれない詳細を追加することがあります。OpenAIは、この動作を「事実に正確ではない結果」として説明しています。 モデルの真実性に関するガイダンス.

この用語は便利な略語ですが、誤ったメンタルモデルを招く可能性があります。言語モデルは通常、完全な事実を取得し、それを変更すると決定することはありません。プロンプトからの続き、学習したパラメータ、および推論時に供給されるコンテキストから推測を行います。明確な説明を生成するメカニズムは、プロンプトが存在すべきことを強く暗示する場所で信じられる名前、日付、引用、またはURLを生成することもできます。

幻覚は小さなエラーから完全に作り上げられた物語に至るまで様々です。要約は全体の意味を保持するかもしれませんが、ソースに誤った数を割り当てることがあります。研究回答は、決して出版されなかった信憑性のあるタイトルの論文を引用するかもしれません。サポートアシスタントはアカウントポリシーを創作するかもしれません。共通の特徴は、誤りの大きさではなく、主張とそれを支持するために利用可能な証拠との間のギャップです。

AIモデルが幻覚を持つ理由

AIモデルが幻覚を持つのは、次のトークン予測が信頼できる継続を報酬する一方で、事実の不確実性が常に「不明」として視覚化されるわけではないからです。トレーニングデータには矛盾、古いパッセージ、不完全な記録、風刺、および繰り返しのエラーも含まれています。クリーンなトレーニングコーパスでさえ、ユーザーが尋ねる可能性のあるすべてのプライベート文書、最近のイベント、狭いドメインルールを含むことはできません。

プロンプトの形は重要です。偽の出来事を前提とする質問は、モデルが要求されたストーリーを完成させる方向に誘導し、前提に挑戦する代わりになります。長い会話は関連する制約を埋め込むことがあります。ツールの出力は、検索結果が話題外のものである場合、パーサーがコンテキストを取り除く場合、または取得したテキストが異なる意味で同じ用語を使用する場合にもエラーを導入します。

トレーニング後は、拒否、キャリブレーション、および指示の遵守を改善することができますが、どのトレーニング方法も無制限の生成を完全に信頼できるデータベースに変えることはありません。 言語モデルが幻覚を持つ理由に関するOpenAIの研究論文は 不確実性を認めることよりも推測を報酬する評価インセンティブに問題を結びつけます。その観察は、忌避が設計され、測定される必要がある理由を説明しており、単にプロンプトで要求されるものではありません。

AI幻覚の一般的なタイプ

タイプ何が起こるか典型的な信号
事実の捏造回答は、エンティティ、出来事、数字、または関係を創造します。その主張は権威あるソースに見つかりません。
引用の捏造タイトル、著者、URL、または引用が作成されたり、誤ったりします。引用された項目が欠落しているか、文を支持していません。
ソースの矛盾応答がプロンプトまたは取得文脈で提供されたテキストと対立しています。直接の比較はサポートされていない追加を明らかにします。
指示の漂流モデルは制約に従うのをやめて、代わりに馴染みのあるパターンを完成させます。出力は範囲、形式、または決定基準を変更します。
推論エラー前提は正しいかもしれませんが、推論、計算、比較が失敗します。中間ステップを再計算することで結果が変わります。

これらのカテゴリは重複します。作り上げられた引用は推論エラーを支持することもあり、古い事実は現在の文書が存在する場合にはソースの矛盾になることがあります。分類は依然として有用です。なぜなら、各失敗が異なるコントロールを必要とするからです。引用チェックは誤った算数を捕まえられない一方で、計算機はソース自体が古くなっていることを明らかにすることはありません。

幻覚された出力を検出する方法

回答を主張に分解する

検証可能な主張をそれぞれ別にマークします。1つの誤った詳細が含まれる段落は、その広いテーマが合理的であるという理由で通過してはいけません。

主張を証拠に一致させる

同じ主題、時間帯、範囲、単位を支持するソースの段落を求める。キーワードのオーバーラップだけでは十分なサポートにはなりません。

計算を独自に確認する

同じモデルに自己評価を求めるのではなく、決定論的なコードや計算機を使って合計、変換、ランキング、比較を再計算する。

不確実性を探る

欠けている証拠、どの仮定が結果を導くのか、何が答えを変えるかを尋ねる。安定したシステムは、境界を隠すのではなく露呈させる。

最も強力な評価は、既知の質問と文書化された期待される回答を使用します。曖昧な主張には人間のレビューが依然として必要ですが、再現可能なテストセットは、プロンプト、モデル、検索の変更、または新しいデータソースがシステムを改善したかどうかを明らかにします。 NIST AIリスク管理フレームワーク は、1つのモデルのスコアを安全性の証明として扱うのではなく、リスクをマッピング、測定、管理するための広範な構造を提供します。

基盤が幻覚リスクを減少させる方法

基盤は、関連する検査可能な証拠をモデルの作業コンテキストに配置し、応答がその証拠内に留まるように求めることによって幻覚リスクを減少させます。リトリーバル強化生成は一般的な設計の1つです:ドキュメントを収集し、検索可能なユニットに分割し、質問に一致するユニットを取得し、引用または引用されたサポートを持つ回答を生成します。

新鮮なウェブ証拠は、質問が変更されるページ、現在の製品情報、公告、または最近の研究を含む場合に役立ちます。ブラウザ支援の収集レイヤーは、抽出の前にJavaScriptページをレンダリングを行い、アプリケーションはページのURL、キャプチャ時間、および回答に使用されるテキストを保存します。Scrapeless Scraping Browserはその収集レイヤーとして機能します。モデルと検証ポリシーはシステムの別々の部分として残ります。

基板は、取得が失敗したときに失敗します。インデックスが関連する文書を省略する場合や、意味的検索が隣接する概念を返す場合、または長いチャンクが矛盾する箇所を含む場合があります。安全なパイプラインは、生成の前にソースのアイデンティティ、文書の年齢、アクセス範囲、取得の関連性をチェックします。さらに、リンクを保持し、レビュアーが切り離された抜粋を信頼するのではなく、元の資料を検査できるようにします。オリジナルの 取得強化生成研究 は、取得と生成を1つのシステムの関連部分としてフレームします。

実用的な幻覚制御ワークフロー

実用的な制御ワークフローは、プロンプトがモデルに達する前に始まります。アプリケーションが行うことを許可されている主張、権威のあるソース、そしてどの決定が人間の承認を必要とするのかを定義します。それから、ソースメタデータを使用して証拠を収集し、狭く取得し、モデルにサポートを引用するように指示し、ユーザーに届く前に出力を検証します。

  1. リクエストをリスクと新鮮さで分類する。医療、法務、財務、安全、アカウントの決定はブレインストーミングよりも厳格な管理が必要です。
  2. 承認されたソースから現在またはドメイン特定の証拠を入手します。標準のURLを保持し、意味を保つために周囲のテキストを十分にキャプチャします。
  3. 日付、管轄、製品、または文書のバージョンなどの意味的関連性とメタデータフィルターを使用して証拠を取得します。
  4. 限られた指示を使用して生成します:提供された証拠から答え、対立を特定し、サポートが欠けているときは abstain します。
  5. 可能な限り決定論的なチェックで引用、数量、名前、および必要な制約を検証します。
  6. 質問、取得した証拠、回答、およびレビューの結果をログに記録し、繰り返される失敗パターンをテストケースにします。

そのシーケンスは、観察可能なステージを伴うエンジニアリングリスクとして幻覚を扱います。それはゼロエラーを約束するものではありません。これは、サポートされていない主張を防ぎ、検出し、調査し、修正することを容易にします。

幻覚の緩和の限界

単一の制御が幻覚を排除するわけではありません。長いプロンプトは証拠を追加できますが、同時に気を散らす要因を導入する可能性もあります。多くの取得された文書はリコールを改善しながら精度を減少させる可能性があります。引用は弱いソースを指していても安心感を与えることがあります。第二のモデルは、いくつかの間違いをキャッチすることができますが、両方のシステムが似たパターンを学んでいるため、同じ誤解を繰り返すことがあります。

チームは、自分たちのアプリケーションにとって重要な失敗、すなわちサポートされていない主張の割合、引用の精度、abstention の質、修正のタイム、または高リスクの回答の中でアクションの前にレビューされる割合を測定すべきです。全ての質問を礼儀正しく拒否するシステムは、事実性では高得点を得るかもしれませんが、ユーザーに対して失敗するかもしれません。有用な目標は、エビデンスが薄いところで保守的な振る舞いと支援のカバレッジをバランスよく取ります。

結論

AIにおける幻覚は、未支持の出力問題であり、トーンの問題ではありません。答えは流暢で詳細でありながら同時に間違っているかもしれません。信頼できるシステムは、生成を証拠取得から分離し、適切なレベルで主張をテストし、不確実性を露呈させ、人々に重要な決定を行わせます。現在のソースとの基盤はリスクを減少させ、引用チェックとアプリケーション特定の評価は、制御が実際に機能しているかどうかを示します。

基盤を持ったAIワークフローを構築する準備はできましたか?

管理されたブラウザレイヤーで現在の公開ウェブコンテンツを取得およびエージェントワークフローに接続します。

今すぐサインアップして $5の無料クレジットを獲得してくださいクレジットカードは不要です.

$5のクレジットを請求する →

FAQ

AIの幻覚は嘘と同じですか?

いいえ。嘘は欺く意図を含意しますが、AIの幻覚は未支持の生成されたコンテンツを表現します。言語モデルは、誤った主張を生成するために意図を必要としません。安全なエンジニアリングの反応は、出力を証拠に対して検証し、証拠が欠けているときにシステムを abstain に設計することです。

取得強化生成は幻覚を排除できますか?

番号。リトリーバル拡張生成は、関連する証拠を提供することで支持されていない回答を減らすことができますが、リトリーバルは正しいソースを見逃したり、誤解を招くコンテキストを返すことがあります。システムは、ソースチェック、引用の検証、対立の処理、取得した資料が答えられない質問への明確な回答が必要です。

ユーザーはどのようにして幻想的な引用を見抜くことができますか?

引用を開いて、タイトル、著者、出版物、引用された主張がすべて一致していることを確認してください。本物のURLだけでは不十分です。なぜなら、そのページが関連するトピックについて説明している可能性があるからです。回答に使われている正確な主題、時間枠、数値をソースで検索してください。

自信のある回答は、モデルが確信していることを意味しますか?

いいえ。自信にあふれた言葉遣いは生成されたスタイルであり、主張が真実であるという校正された確率ではありません。いくつかのシステムは自信の推定値や引用を明らかにすることができますが、ユーザーは依然として証拠の質と回答に基づいて行動することの結果を判断する必要があります。

AIの回答を人間がレビューすべき時はいつですか?

人間のレビューは、回答が健康、法的権利、お金、安全、雇用、アクセス、または他の人に影響を与える可能性がある場合に適切です。また、ソースが異なる場合、リクエストが最近の出来事に依存している場合、またはシステムが主要な主張に対する直接的なサポートを提供できない場合にもレビューは有用です。

参考文献