制作過程を公開 · ラボ実験
ブラウザ内機械学習

Skyline Run AI Lab

ブラウザーを離れずに、7種類の学習手法を訓練・観察・比較できます。

基本設定から始める

PPOは推奨設定から始まります。地区1で訓練し、地区2と3で検証します。ライブシミュレーションの横で訓練を開始するか、詳細セクションでワールドの変更、ポリシー管理、診断の確認を行えます。

訓練設定

7種類すべてが同じ制約なしの操作条件で訓練され、アルゴリズムを切り替えても選択したワールドは維持されます。デモはPPO専用、報酬制御はプレーンNEAT専用です。
再現性

このブラウザーに保存済み

このブラウザーに保存されたモデルはまだありません。

実行と確認

待機中 環境ステップ: 0
その他の実行統計
評価ステップ: 0 0 ticks/s
速度
描画をオフにすると最高速度で訓練できます。
感知タイルを重ねて、ネットワークへの入力をそのまま確認できます。

訓練によって評価済みポリシーが生成されると、保存と観察の操作を利用できます。

ライブニューラルネットワーク

ネットワークの最初の判断を待機中…

訓練ワールド

推奨設定では主地区で訓練し、別の2つのキャンペーン地区で検証します。汎化を試す場合は、これらのワールドを明示的に変更してください。

訓練地区
検証ワールド
手法固有のオプション
人間のデモ 行動クローニングのデモはPPOでのみ利用できます。
トレーナーAI 報酬コントローラー訓練はプレーンNEATでのみ利用できます。

人間のデモ

PPOは、現在の訓練セットに含まれるキャンペーン地区の対象走行を、強化学習前の行動クローニングに利用できます。

保存済みデモ0件中0件が、選択した訓練地区で利用できます。

保存済みのデモはまだありません。プレイ可能なゲームで地区をクリアし、走行を保存してください。

ポリシーと評価

アクティブポリシー

評価済みのアクティブポリシーはまだありません。

ポリシーをテスト

選択したポリシーを全キャンペーン地区と新しい5つの生成ワールドでテストします。結果には通常パスと25%スティッキーアクションのパスが含まれ、ポリシー選択には影響しません。

比較ロスター

比較ロスターにポリシーはありません。

診断 アルゴリズム固有の訓練チャートとネットワーク診断を表示
イテレーション 0 エピソード 0 最高進捗: 0 px 生存エージェント数: 0 0 ticks/s 待機中 環境ステップ: 0 評価ステップ: 0
エピソード報酬

訓練を開始するとメトリクスが表示されます。

正規化エピソード進捗

訓練を開始するとメトリクスが表示されます。

エピソードの平均進捗

訓練を開始するとメトリクスが表示されます。

訓練損失

訓練を開始するとメトリクスが表示されます。

方策エントロピー

訓練を開始するとメトリクスが表示されます。

世代ごとのクリア数

訓練を開始するとメトリクスが表示されます。