The “it” in AI models is the dataset.
(特徴的な図を写真一枚で)
概要
- 同じデータセットを用いて十分に学習された場合、モデルのアーキテクチャやハイパラやオプティマイザーなどに関わらず同一化するという主張。
- なのでデータセット勝負。
- それはそうという気もしなくもないが、まあデータセット大事なのは本当にそう。
OpenAIに入社してもうすぐ1年になります。その間、たくさんの生成モデルをトレーニングしてきました。訓練する権利がある人よりも多いくらいだ。様々なモデル構成やハイパーパラメータを調整する効果を観察するのに時間を費やしてきた中で、ひとつ印象的だったのは、すべてのトレーニング実行の間に共通点があるということだ。これらのモデルは、信じられないほどデータセットに近似しているのだ。つまり、犬や猫であることの意味だけでなく、人間がどのような写真を撮りやすいかとか、人間がよく書き留める言葉など、どうでもいいような分布の間に存在する頻度も学習しているのだ。同じデータセットで十分な期間訓練すると、十分な重みと訓練時間を持つほぼすべてのモデルが同じ点に収束する。十分な大きさの拡散conv-unetsは、ViTジェネレーターと同じ画像を生成する。ARサンプリングは拡散と同じ画像を生成する。これは驚くべき観察である!これは、モデルの振る舞いが、アーキテクチャ、ハイパーパラメータ、オプティマイザの選択によって決まるのではないことを示唆している。データセットによって決まるのであって、それ以外の何ものでもない。他のすべては、そのデータセットを近似するために計算量を効率的に提供するための手段なのだ。では、あなたが「ラムダ」、「ChatGPT」、「バルド」、「クロード」に言及するとき、あなたが言及しているのはモデルの重みではない。データセットなのだ。