Vision and Languageの現状と展望(GPT-4)

 
 

概要

  • GPT-4がどのような性能を持っているかについて説明
    • V&Lベンチマークだとほとんどのタスクで既存研究より高精度
    • VQAv2、LSMDCでは劣ってる
      • VQAv2:単純なYes/No, 5W1Hに関する質疑応答
      • LSMDC:動画の説明文生成タスク
      • 「画像理解」が重要なタスク。画像認識部分が既存のものより劣ってるかも
  • GPT-4の構造について既存研究を踏まえて予想
    • Encoder-Decoder or Decoder
  • GPT-4に何ができて何ができないかについてのサーベイ論文についてもまとめている
    • コーディングが今までに比べて格段に得意
    • 時事問題や計算問題が苦手
    • 次単語予測で学習させているため、プランニングができない
      • 文末の単語から文頭を考えられない