2024-08-01から1ヶ月間の記事一覧
Advances in Preference-based Reinforcement Learning: A Review 強化学習の問題点の一つとして報酬関数の設計がパフォーマンスに大きく影響してしまう点がある。PbRLでは、絶対的なスコアでの報酬ではなくペアの良し悪しという形で暗黙的な報酬信号を用い…
論文1 : Decision-RWKV この論文ではLifelong Learningの問題に対してDecision-RWKVを使って対処しようとしている。Decision-RWKV自体の理解もしたいとはいえちょっと後回しにして、まずは「2.4 Related Work on Lifelong Robot Learning」に触れる。ここで…
あまりの惨敗だったので久しぶりに復習。 レートに上向き矢印が付いたことで1700台から1600台へ落ちることに降格感が強く出るようになっている。 D - AtCoder Janken 3 補足みたいなケースになかなか気づかなくてWAを何回か出してしまった。どうすれば察知で…