学習するゲノム編集者:モデルはランダムより上手くNEATを変異させられるか
訓練済み編集スコアラーがランダムな構造変異を上回れるかを、新しいシードと初回実行前に固定した手順で検証します。
「強化学習」についてのラボノートです。
訓練済み編集スコアラーがランダムな構造変異を上回れるかを、新しいシードと初回実行前に固定した手順で検証します。
学習した重みを捨てるか、継承するか、経験を一つの学習器に集めるか。三つのハイブリッド方式を同じ基準で比べます。
失敗したチャンピオンを起点に、方策が幸運な経路を再生せず、未見のSkyline Runレベルを読めるか試します。
測定に基づく生成器が攻略可能な地区を作り、訓練用と検証用のレベルを分け、経路の暗記を見える形にします。
決定論的なエンジンをブラウザ上の人工知能ラボに変えると、訓練前の環境変化まで計測で見えてきました。
報酬を手調整から解放する。自動強化学習は訓練設定を自動探索し、集団ベース訓練は最良の実行をコピーして設定を揺さぶる。
刷新したAIラボは固定予算内で学習しました。しかし生成世界のクリアは0/630で、より広い訓練でも汎化は確認できませんでした。