深度學習需要解決一個高維且非凸優化之問題,解決這些問題的難點在於,他可能具有多個好的解(local minimum),導致學習演算法(神經網路/loss)難以收斂到一個全域最佳值(global minimum)
這種問題在隨機優化領域(stochastic optimization)中,被稱為優化演算法的收斂問題(problems with the convergence of the optimization algorithm on a solution),而需要被收斂的解,在演算法中為一組權重(weight values),深度學習也屬於隨機優化領域,因此也面臨此問題,其權重通常以.h5檔案格式儲存
觀察神經網路訓練時每一個 epoch 的 loss,若不斷震盪,且平均來說不下降,則表示無法收斂
而解決此問題的方式有可以透過調參或等等,但這次,討論的是在不更動參數以及網路結構的情況下,如何利用已產生的權重檔,來達到較佳的 test 結果
方法是,在訓練過程即將結束時合併所收集的權重,通常這可以稱為時間平均(temporal averaging),或以發明此方法的人 Polyak-Ruppert 命名,稱為 Polyak Averaging






