強化学習への関心とテキストとか
強化学習への関心は前からあった、仕事では直接扱わないのでずっと後回しだったけど。
無償教材とか素材がだいぶ集まったのと、DeepSeekが大規模な強化学習(RL)にリソースを割り振るという新しいやり方を見つけて話題になってるとか、ロボットとかphysical aiの方でも使われてるとかの動向があったので、これを機に入門的な情報から整理。
OpenAIは先駆者の苦労をアッサリパクられるのは嫌だから、だからo1は推論スケーリングだよとほのめかしただけで技術的な詳細は隠したし、思考トークンも非表示にして出力からSFT教師データを作れないようにした。世の中は「きっとOpenAIは色んな工夫をやってo1作ったんだろうなあ…」と思い込んだし、…
— うみゆき@AI研究 (@umiyuki_ai) January 29, 2025
日本語でサクッと目を通すにはゼロから始める深層強化学習 / Introduction of Deep Reinforcement Learningとか以下かなぁ、少し偏ってる感があるけど
若い頃に強化学習の文献を少し読んだけど、構成や論理展開が独特で馴染めなかった。ツイートで流れてきたところによると、このチュートリアルの第1章は、機械学習の部分集合として強化学習を自然に記述していておすすめだとか。
他に古典的な強化学習理論についてまとめているReinforcement Learning: An Introductionとか、以下とかgithub上の書籍Mathematical Foundations of Reinforcement Learning、そして以下とかかな
LLM開発における強化学習のサーベイがあった!
DeepSeekなどLLMのチューニングに活用される強化学習についても追加
以前はロボット分野で耳にしていた。Mathematical Methods for Computer Vision, Robotics, and Graphicsとか、R1-V: Reinforcing Super Generalization Ability in Vision Language Models with Less Than $3
あとは以下のシリーズ、全て遡って読んでないけれど、使ってることはわかる。
一方で、他分野への連結という意味では以下の論文も見つけたけど、なんか昔見た強化学習って感じで読んでて気持ち悪い。。。
Linear Programming in Reinforcement Learning
反実仮想機械学習に関する手法とかのまとめとか他の記事の中に要素技術として含まれるものが多いので、より良い整理方法があれば今後対応する。
他の情報を見たい方は、目次ページへ
仕切り直しで収集情報の整理から|くすぐったがり|note
