橫座標: reward 縱座標: 時間 只須取最後 5 個 iteration 透過這個表格,可以看出訓練模型的狀態如何,照理來說應該要是高reward --> 高車速。當出現高reward -->低車速,就表示有問題
橫座標: reward
縱座標: 時間
只須取最後 5 個 iteration
透過這個表格,可以看出訓練模型的狀態如何,照理來說應該要是高reward --> 高車速。當出現高reward -->低車速,就表示有問題