A Survey on Hallucination in Large Language Models: Principles, Taxonomy, Challenges, and Open Questions

概要

  • Hallucinationの分類方法を提案
  • Hallucinationに寄与する要因を分類
  • Hallucinationの検出方法とベンチマークの紹介
  • Hallucinationを軽減するアプローチの紹介
  • 課題と未解決問題の紹介
 

Introduction

  • 既存のHallucinationの定義
    • https://dl.acm.org/doi/10.1145/3571730
    • https://arxiv.org/abs/2202.03629
      • 分類
        • intrinsic hallucination (内因性?)
          • ソースの内容に反する出力
        • extrinsic hallucination(外因性?)
          • ソースの内容からは検証できない出力
          • 誤っているとは限らず、もし合っていたら追加情報となるが、事実の安全性の観点からリスクを増加させる
        • しかしこれは、ドメインspecificのタスクの場合結果が変わる
        • ドメインspecificのタスクの方がhallucinationがamplifiyされる
      • 貢献
        • 本論文での分類
          • factuality hallucinationとfaithfulness hallucinationに分類する
            • factuality hallucination(事実性)
              • 生成されたコンテンツと検証可能な実世界の事実との間の不一致を指す
              • 一般的には事実の不整合や捏造
              • さらに2つに細分化
                • factual inconsistency(事実的矛盾)
                • factual fabrication(事実的捏造)
            • faithfulness hallucination(忠実性)
              • 生成されたコンテンツがユーザーの指示や入力によって提供された文脈から逸脱すること、および生成されたコンテンツ内の自己一貫性の欠如を指す
              • ユーザーの視点からの矛盾に焦点を当て3つに分類
                • instruction inconsistency(指示の矛盾)
                • context inconsistency (文脈の矛盾)
                • logical inconsistency(論理の矛盾)
        • 原因の分類
          • data、training、inferenceの3つのステージに焦点を当てる
            • data
              • flawed sources and suboptimal utilization
            • training
              • inferior training strategies that may induce hallucinations during pre-training and alignment
            • inference
              • those stemming from the stochastic nature of decoding strategies and imperfect representations during the inference process.
        • hallucinationsの検出方法とベンチマークの網羅的な概観を提供
        • 特定されたhallucinationsの原因を軽減するための包括的な戦略
 
  • 先行研究
    • 先行研究はたくさんある
      • Ji et al., 2023aはpre-trained language modelsに対するhallucinationsに焦点を当てており、LLMは議論の範囲外にしている
      • Liu et al., 2023hはLLMの信頼性を幅広い視点から議論し、Wang et al., 2023cはLLMの事実性に関して深く掘り下げている
    • 本研究
      • 信頼性における課題のサブセットに特化しており、事実性の側面をカバーし、信頼性に関連するhallucinationsを含む議論をさらに広げている
      • Zhang et al., 2023gは最も我々のサーベイにalignしていて、LLM hallucinationsの現象、評価基準、及び軽減戦略の分類を概説している
      • 本研究は分類と組織構造の両方で独自性を持っている
        • レイヤー化された詳細なhallucinationsの分類を提示
        • 構造的にLLMの能力に遡ってhallucinationsの原因を解剖
      • さらに、軽減戦略は根底にある原因と密接に結びづけられたアプローチである

Definitions

  • Large Language Models
    • 一般的に、LLMは、トランスフォーマーベースの言語モデルアーキテクチャを活用し、膨大なテキストコーパスでの広範囲なトレーニングを経ている一連の汎用モデルを指す
  • Training Stages of Large Language Models
    • 3つの主要なtraining stagesがある
      • pre-training
        • 広範囲のテキストデータから言語の構文や世界知識、推論能力を学ぶ
      • supervised fine-tuning (SFT)
        • 事前トレーニングで得た知識を基に、さらに注釈付きの指示と応答のペアを使ってLLMをトレーニングし、能力と制御性を高める
      • reinforcement learning from human feedback (RLHF)
        • 人間の好みに合わせてLLMを調整し、質の高い安全な応答を促すことで、LLMの性能をさらに向上させる
  • Hallucinations in Large Language Models
    • 病理学と心理学の分野に起源を持ち、「現実には存在しないエンティティやイベントの知覚」として定義されている(Macpherson & Platchias, 2013)
    • NLPの領域では、生成された内容が意味不明であるか、提供されたソースコンテンツに忠実でない場合に、この現象をHallucinationsと呼ぶことが一般的です(Filippova, 2020; Maynez et al., 2020)
    • 一般に、自然言語生成タスクにおけるHallucinationsは、内因性と外因性の2つの主要なタイプに分類される(Huang et al., 2021; Li et al., 2022b; Ji et al., 2023a)
    • 内因性はソースコンテンツと矛盾するLLMのアウトプットに関連しており、外因性はソースコンテンツから検証できないLLMの生成を指す
    • 大規模言語モデルは多様な分野で広く利用されており、特定のタスクに特化した分類に限界が生じている
    • LLMはユーザーとのインタラクションに重きを置き、ユーザーの指示との一致を優先することを考慮すると、Hallucinationsは主に事実レベルで表面化するため、Ji et al. (2023a)による分類を土台としたより精緻な分類体系を導入する
      • Factuality Hallucination(事実性)
      • 既存のLLMは実世界の事実と矛盾するか、潜在的に誤解を招く出力を生成する傾向が時折観察される。生成されたコンテンツと検証可能な実世界の事実との間の不一致を指す。一般的には事実の不整合や捏造など。これは2つに細分化できる。
        • factual inconsistency(事実的矛盾)
          • LLMのアウトプットが実世界の情報に基づく事実を含んでいるが、矛盾を示している状況を指す
          • 最も頻繁に発生し、LLMが事実知識を取得、記憶、表現する過程の多様なソースから生じる
          • 例:「月に最初に着陸した人物」について、モデルは誤って「ユーリ・ガガーリン」と生成したが、これは実際の事実と矛盾
        • factual fabrication(事実的捏造)
          • LLMのアウトプットが確立された実世界の知識に対して検証不可能な事実を含む例を指す
          • 例:ユニコーンの起源を示す事実はないが、モデルはユニコーンについて、それっぽい歴史的起源を創作
      • Faithfulness Hallucination(忠実性)
      • LLMは、ユーザーの指示に沿うように訓練されており、ユーザーが提供する指示と文脈情報との一貫性を確保することが重要
      • LMの忠実性は、生成されたコンテンツの論理的一貫性においても反映される
      • これは3つに細分化できる。
        • instruction inconsistency(指示の矛盾)
          • ユーザーの指示から逸脱したLLMの出力を指す
          • 悪意のあるユーザーの入力は安全ガイドライン的に矛盾が生じるかもしれないが、ここでは悪意のないユーザーを想定
          • 例:質問文の翻訳を依頼したが、LLMは誤ってユーザーの指示から逸脱し、代わりに質問応答タスクを実行した
        • context inconsistency (文脈の矛盾)
          • LLMの出力がユーザーが提供した文脈情報に忠実でない場合を指す
          • ユーザーはナイルの源流が中央アフリカの大湖地域にあると述べましたが、LLMの応答は文脈に反して、中央アフリカの山脈にあると述べた
        • logical inconsistency(論理の矛盾)
          • LLMの出力が内部的に論理的矛盾を示す場合を指す
          • 特に推論タスクで観察され、論ステップ自体と最終回答の間の一貫性のなさとして現れる
          • 方程式の両側を2で割るという推論ステップは正しいものの、x=4という最終回答は推論のチェーンと矛盾し、誤った結果になっている

Hallucinationの分類

LLMにおけるHallucinationの根本原因は、主に3つの重要な側面に分類される
  • Hallucination from Data
    • Pre-training dataは大規模言語モデル(LLM)の基礎となっており、一般的な能力と事実知識を得ることを可能にするが、これは意図せずLLMのHallucinationの源となることがある。これは主に2つの側面で現れる。
    • Flawed Data Source(不完全なデータソース)
      • プレトレーニングデータには誤情報や偏見を導入する可能性がある(Bender et al., 2021; Weidinger et al., 2021)
      • また、データの特定のドメイン知識や最新の事実が欠けていると、特定のシナリオにおけるLLMの制限を引き起こす可能性がある
      • これに基づいて、幻覚を引き起こす可能性のある要因を「Misinformation and Biases」、「Knowledge Boundary」という二つのカテゴリに主に分類
      • Misinformation and Biases(誤情報と偏見)
        • 大規模なコーパスは広範囲のデータを提供するものの、誤った情報を不注意に導入し、虚偽情報を提供するリスクを高める可能性がある
        • 加えて、社会的な偏見がLLMの学習プロセスに不注意に導入されることがある
        • Imitative Falsehoods(模倣的虚偽)
          • LLMプレトレーニングの主要な目的は、トレーニング分布を模倣することです。事実上正しくないデータでトレーニングされたLLMは、これらの不正確さを不注意に増幅させる可能性があり、Imitative Falsehoodsと呼ばれる事実上誤ったHallucinationを引き起こす可能性がある(Lin et al., 2022)
          • 例:'トーマス・エジソンが電球を発明した'という声明は、実際には誤信されてきた誤解だが、事実上正しくないデータでトレーニングされたLLMは、誤解を招く出力につながる
        • Duplication Bias(複製バイアス)
          • 大規模言語モデルには、トレーニングデータを記憶する固有の傾向があるが、この固有の記憶能力は、プレトレーニングデータ内の複製された情報が存在すると、一般化から記憶へとLLMを変える可能性があり(Hernandez et al., 2022)、最終的には、複製されたデータの想起を過度に優先する複製バイアスを生み出す
          • 例:ユーザーが「リンゴを除く赤い果物をいくつか挙げて」と要求した場合、トレーニングデータセットで「赤リンゴ、スイカ、チェリー、イチゴ」のような文が頻繁に繰り返されると、モデルは過度に記憶された文を出力に生成する可能性があり
        • Social Biases(社会的バイアス)
          • 性別(Paullada et al., 2021)や国籍(Narayanan Venkit et al., 2023; Ladhak et al., 2023)に関連する偏見は、Hallucinationと密接に関連している。
          • 例えば、ユーザーが提供した文脈に性別が明示的に言及されていなくても、LLMは看護職を女性と関連付ける可能性がある
      • Knowledge Boundary(知識の限界)
        • 大規模なプレトレーニングコーパスはLLMに広範な事実知識を提供しますが、それらは限界を持っています。この限界は主に2つの側面で現れる
          • Domain Knowledge Deficiency(ドメイン知識の不足)
            • LLMが主に広範な公開データセットでトレーニングされているため(Penedo et al., 2023; Raffel et al., 2020; Gao et al., 2021)、特化したドメインにおける専門知識は、専有のトレーニングデータの欠如に制約される
            • 医学(Li et al., 2023g; Singhal et al., 2023)や法律(Yu et al., 2022; Katz et al., 2023)の問題のように、特定のドメイン知識を必要とする問題に直面したとき、これらのモデルは顕著にHallucinationを引き起こす
          • Outdated Factual Knowledge(時代遅れの事実知識)
            • LMに組み込まれた事実知識には明確な時間的境界があり、時間とともに時代遅れになる
            • これらのモデルが一度トレーニングされると、その内部の知識は決して更新されない
            • 時間的範囲を超えるクエリに直面したとき、LLMはしばしば事実を作り上げたり、過去には正しかったかもしれないが今は時代遅れになっている答えを提供する
    • Inferior Data Utilization(データの利用の失敗)
      • 巨大なパラメータと訓練データにより学習されたLLMは,しばしばパラメータ内部に事実や常識などの知識を保持している
      • LLMはパラメータで保持する知識の利用がうまくいかず、知識誘発型のHallucinationを生む可能性がある
        • Knowledge Shortcut(知識の近道・事実の捉え方における偽の相関)
          • LLMが事実知識の複雑さを真に理解するよりも、しばしば近道に頼る
          • LLMはプレトレーニングデータ内の位置的な近さ(Li et al., 2022a)、共起統計(Kang and Choi, 2023)、関連ドキュメント数(Kandpal et al., 2023)に過度に依存する傾向を示し、これは偽の相関へのバイアスを導入し、そのバイアスが事実上誤った情報を反映している場合、Hallucinationにつながる可能性がある
          • 例:「カナダの首都」について問い合わせた際、モデルは誤って「トロント」と回答するが実際にはオタワが正解である。これはカナダとトロントが同時に使われる頻度が高いことに由来する
        • Knowledge Recall Failures(知識の想起の失敗)
          • Long-tail Knowledge(Long-tailな知識)
            • Long-tailな知識はプレトレーニングデータで相対的な希少性を持つ
            • 共起パターンに基づいて事実的な知識を記憶するLLMにとっては、Long-tailな知識を問う質問に対しては不正確な回答を生成する可能性が高い
            • 例:Wikipedia内においてはLong-tailなエンテティに対する伝記を生成するように求められたとき、職業を誤って政治家を教育者として記述した
          • Complex Scenario(複雑なシナリオ)
            • 知識の効果的な利用は推論能力と密接に関連している
            • 例えば、複数ステップの質問応答シナリオでは、LLMが必要な知識を持っていても、質問間に複数の関連性が存在するため、正確な結果を生成することに苦労する(Zheng et al., 2023)
            • Reversal Curse(Berglund et al. 2023)
              • 具体的には、質問が「AはBである」として形成されたときには正確に答えることができる一方で、逆の「BはAである」と尋ねられたときには論理的演繹に失敗する
            • モデルのコンテキストウィンドウ内に正解を含む文書があっても、提供された証拠を効果的に利用する能力の不足のために、正確な回答を生成することに苦労することもある
            • 例:エベレストを世界最高峰と認識しているにもかかわらず、エベレストの標高が500メートル減少した場合に最も高い山になるものを決定することに失敗
    • Summary
      • LLMにおけるデータ関連のHallucinationは、主に不完全なデータソースとデータの利用の失敗に根ざす
  • Hallucination from Training
    • Hallucination from Pre-training
      • Architecture Flaw(アーキテクチャの不具合)
        • Inadequate Unidirectional Representation.
          • 因果関係のある言語モデリングパラダイムに従い、LLMは左から右へと前のトークンに基づいて次のトークンを予測する
          • 単方向モデリングは効率的なトレーニングを促進するが、単一方向からのコンテキストのみを利用することで、複雑な文脈依存性を捉える能力が阻害されHallucinationの原因になる(Li et al., 2023h)
        • Attention Glitches
          • self-attention moduleを備えたTransformerベースのアーキテクチャは広範囲の依存関係をキャプチャできるが、アルゴリズミックな推論の文脈で、モデルの規模にかかわらず、長距離および短距離の依存性にまたがる予測不可能な推論エラーを時折示すことがある(Liu et al., 2023a)
          • 一つの可能性としては、シーケンス長が増加するにつれて注意が位置全体に希釈されるソフトアテンションによる限界がある(Hahn, 2020; Chiang and Cholak, 2022)
         
      • Exposure Bias(露出バイアス)
        • トレーニング戦略も重要で、特に、露出バイアスという現象(Bengio et al., 2015; Ranzato et al., 2016)は、自己回帰生成モデルにおけるトレーニングと推論の間の不一致から生じる
        • トレーニング中はこれらのモデルは通常、教師強制の最尤推定(MLE)トレーニング戦略を使用し、正解のトークンを入力として提供されるが、推論中には、モデルは自身が生成したトークンに依存して後続の予測を行うので、生成された誤ったトークンが後続のシーケンス全体にエラーを連鎖させ雪だるま式にHallucinationを発生させる可能性がある
    • Hallucination from Alignment
      • アライメントは、教師ありのfine-tuningと人間のフィードバックからの強化学習を主としており、LLMの能力を人間の嗜好に合わせるための重要なステップ
      • アライメントはLLMの応答品質を著しく向上させる一方で、Hallucinationを誘発するリスクもある
      • Capability Misalignment(能力とのずれ)
        • 教師ありのfine-tuningは品質の高い指示とそれに応答するレスポンスによってLLMの能力を向上させるが、LLMの能力が拡大するにつれて、LLMの固有の能力とアノテーションデータに描かれた能力との間の潜在的な不一致が問題となる
        • アライメントデータの要求がこれら事前に定義された能力の境界を超えると、LLMは自身の知識を超えるコンテンツを生成するようにトレーニングされHallucinationを誘発する
      • Belief Misalignment(信念とのずれ)
        • いくつかの研究は、LLMが、生成されたステートメントの真実性に関連する内部信念を包含していることを示している(Burns et al., 2022; Azaria and Mitchell, 2023)が、内部信念と生成されたアウトプットとの間には、時折不一致が生じることがある
        • 例えば、LLMが人間のフィードバックで洗練されていても(Ouyang et al., 2022)、時には内部信念と異なるアウトプットを生成することがあり、これは真実性を犠牲にしてでも人間の評価者を喜ばせるモデルの傾向を示す(sycophancy)(Cotra, 2021)
        • 最近の研究は人間のフィードバックからの強化学習(RLFH)を通じて訓練されたモデルはユーザーの意見に迎合する顕著な行動を示すことを指摘
        • このような迎合的行動は、明確な答えのない曖昧な質問(Perez et al., 2023)に限定されず、モデルがその不正確さを認識しているにもかかわらず明らかに誤った答えを選択する場合にも生じる(Wei et al., 2023)
    • Summary
      • LLMをトレーニングする際、基礎となるプレトレーニングとその後のアライメントの両方が、独自の課題を提起し、幻覚を引き起こす可能性となる
  • Hallucination from Inference
    • デコーディングプロセスに根ざした潜在的なHallucinationの原因について掘り下げる
    • Inherent Sampling Randomness(サンプリングのランダム性)
      • LMは高度に創造的で多様なコンテンツを生成するが、この能力はデコーディング戦略におけるランダム性が重要な役割を果たしている
      • 確率的サンプリング(Fan et al., 2018; Holtzman et al., 2020)は現在、LLMによって採用されている主要なデコーディング戦略
      • デコーディング戦略にランダム性を取り入れる理由は、高確率のシーケンスが驚くほど低品質のテキストに結果することが多いからで、可能性の罠」と呼ばれている(Stahlberg and Byrne, 2019; Holtzman et al., 2020; Meister et al., 2020; Zhang et al., 2021)
      • サンプリングのTemperatureを高くすると、より均一なトークン確率分布になり、分布の末尾から低頻度のトークンをサンプリングする可能性が高まり、結果として、稀に発生するトークンをサンプリングする傾向が高まり、Hallucinationのリスクが高まる(Aksitov et al., 2023)
    • Imperfect Decoding Representation(不完全なデコーディング表現)
      • Insufficient Context Attention(文脈の欠如)
        • エンコーダーデコーダーアーキテクチャを採用する生成モデルにおけるover-confidenceの問題
        • 部分的に生成されたコンテンツに過度に焦点を当てることから生じ、しばしば、ソース文脈に忠実に従うことを犠牲にして流暢さを優先させてしまう
        • 主に因果関係のある言語モデルアーキテクチャを採用する大規模言語モデルは広く使用されていますが、over-confidenceは依然として残っている
        • 長くて包括的な応答を生成する傾向があるLLMでは、この懸念がさらに増幅され、指示忘れのリスクも高まり(Chen et al., 2023f; Liu et al., 2023i)、モデルが元の文脈から逸脱したコンテンツを出力するFaithfulness Hallucinationを誘発する可能性になる
      • Softmax Bottleneck
        • ほとんどの言語モデルは、言語モデルの最終層の表現とword embeddingを組み合わせて、単語予測するためにSoftmax層を利用するが、フトマックスボトルネックによって阻害される
        • フトマックスボトルネックはSoftmaxベースの言語モデルは、ソフトマックスとdistributed word embeddingsの使用が、文脈に基づいて出力確率分布の表現力を制約し、言語モデルが望む分布を出力することを妨げる
        • Chang and McCallum (2022)は、出力単語埋め込み空間内の望ましい分布が複数のモードを示している場合、言語モデルはすべてのモードから最も優先すべき単語を正確に優先することが難しくなり、Hallucinationを誘発することを示した
    • Summary
      • デコーディングフェーズでは、固有のデコーディング戦略と予測に使用される表現の両方から課題が生じる

Hallucination検出方法とベンチマーク

  • 人間らしいテキストを生成することに長けたモデルが増えるにつれ、正確なコンテンツと幻覚的なコンテンツを区別することが極めて重要な関心事
  • Hallucination検出
  • 従来のメトリクスは、主に単語の重複に依存するため、もっともらしいコンテンツと幻覚的なコンテンツの間のニュアンスの違いを区別するのに不十分
  • LLM幻覚に合わせたより高度な検出方法の必要性
    • Factuality Hallucinationの検出
      • Retrieve External Facts(外部情報の取得)
        • LLM出力における事実の不正確さを効果的に特定するために、モデルが生成したコンテンツと信頼できる知識源を比較することがある
        • この方法は、(Guo et al., 2022)で定義された事実確認タスクのワークフローと密接に関係しているが、従来のファクトチェック手法(Augenstein et al., 2019; Hanselo wski et al., 2019; Atanasova et al., 2020) は、実用性のために単純化された仮定を取り入れることが多く、複雑な実世界のシナリオに適用するのが難しい
        • これらに対処するために、Chenら(2023c)は、時間制約をつけてキュレーションされていないのウェブソースから証拠を調達する手法を提案
      • Uncertainty Estimation(不確かさの推定)
      • 外部のリソースに依存する手法が多い中、retrievalすることなく、リソースなしでこの問題に取り組む手法もある
      • そもそもHallucinationモデルのuncertaintyに結びつくものなので、事実性に関するuncertaintyを予測することがHallucinationの検知に寄与する
        • LLM Internal States
          • LLMの内部状態はトークンの確率やエントロピーなどを不確実性を示す情報豊富な指標として利用できる
          • Varshney et al. (2023)は、重要な概念に対するモデルの不確実性を、トークンの確率の最小値を利用して定量化。
          • Luo et al. (2023a)は、言語モデルが生成した説明から元の概念を再構築する能力がその概念に対する習熟度を示すという理論に基づいて、自己評価に基づくアプローチを不確実性推定に利用
          • Yao et al. (2023a)は敵対的攻撃の観点からHallucinationを解釈し、勾配に基づくトークン置換を利用して、Hallucinationを誘発するプロンプトを調べた結果、生のプロンプトから生成された最初のトークンは、敵対的攻撃からのものと比べて低エントロピーを示すことから、Hallucinationを定義するためのエントロピーの閾値を設定することを提案
        • LLM Behavior
          • システムがAPI呼び出し(OpenAI, 2022; Google, 2023; Microsoft, 2023)を介してのみアクセス可能な場合、出力のトークンレベルの確率分布へのアクセスは利用できない
          • この制約を考慮して、いくつかの研究は、自然言語のプロンプト(Xiong et al., 2023; Kadavath et al., 2022)を通じて、またはその行動的な表れを調べることによって、モデルの不確実性を探ることに焦点を移した
          • Manakul et al. (2023)は、同じプロンプトに対してLLMから複数の応答をサンプリングし、事実的な声明の一貫性を評価することによっHallucinationを検出する。これらの方法は主に、モデルに対して情報や確認を明示的に求める直接的なクエリに依存しています。
          • Agrawal et al.(2023)は、捜査インタビューにヒントを得て、間接的なクエリの使用を提唱し、特定の情報を引き出すためにオープンエンドの質問を提示する。複数のモデル生成にわたる一貫性をより良く評価できる。
          • 法的な尋問実践から着想を得たCohen et al.(2023)は、LMvLMアプローチを提案し、「試験官」LMを利用して「受験者」LMに質問し、複数ターンのインタラクション中に主張の矛盾を明らかにすることを目指す
    • Faithfulness Hallucinationの検出
    • LLMが文脈やユーザーの指示に忠実であることを保証することは、その実用性にとって不可欠
    • Faithfulness Hallucinationの検出は生成されたコンテンツが与えられた文脈と一致していることを保証することに重点を置き、余計なまたは矛盾する出力の潜在的な落とし穴を避ける
    • ベンチマーク
       

      Hallucinationの軽減

      • Hallucinationsを軽減するための現代的な方法をHallucinationsの原因(§3)に基づき、データ関連のHallucinations(§5.1)、トレーニング関連のHallucinations(§5.2)、および推論関連のHallucinations(§5.3)に対処するアプローチに焦点を当て、それぞれの原因に固有の特定の課題に対処するために特化した解決策を提供する
      • Mitigating Data-related Hallucinations
      • データ関連のHallucinationは一般にトレーニングデータに根ざしたバイアス、誤情報、および知識のギャップから生まれる
      • この文脈では、誤情報とバイアスの発生を最小限に抑えつつ、知識の増強とLLMによる知識の効果的な活用の向上を目指して、そのようなHallucinationを軽減するための様々な戦略を探求する
        • Mitigating Training-related Hallucination
          • Mitigating Inference-related Hallucination
          • デコーディング戦略は、生成されたコンテンツの事実性と信頼性を決定する上で中心的な役割を果たすが、不完全なデコーディングは、事実性を欠いたり元の文脈から逸脱したりする出力をもたらすことがしばしばある
             

            Challenges and Open Questions

            • Can Self-Correct Mechanisms Help in Mitigating Reasoning Hallucinations?
              • Can We Accurately Capture LLM Knowledge Boundaries?
                • How Can We Strike a Balance between Creativity and Factuality?
                   

                  Conclusion