Vision and Languageの現状と展望(GPT-4)

概要
- GPT-4がどのような性能を持っているかについて説明
- V&Lベンチマークだとほとんどのタスクで既存研究より高精度
- VQAv2、LSMDCでは劣ってる
- VQAv2:単純なYes/No, 5W1Hに関する質疑応答
- LSMDC:動画の説明文生成タスク
- 「画像理解」が重要なタスク。画像認識部分が既存のものより劣ってるかも
- GPT-4の構造について既存研究を踏まえて予想
- Encoder-Decoder or Decoder
- GPT-4に何ができて何ができないかについてのサーベイ論文についてもまとめている
- コーディングが今までに比べて格段に得意
- 時事問題や計算問題が苦手
- 次単語予測で学習させているため、プランニングができない
- 文末の単語から文頭を考えられない