結合機器學習模型與地統計方法的太空光達森林地上生物量估算Forest aboveground biomass estimation based on spaceborne LiDAR combining machine learning model and geostatistical method
森林數位孿生方法平台
GEDI 光斑越密反而越糟,這篇用每 100 shots 抽稀加反距離權重內插,再以隨機森林把香格里拉雲杉冷杉的地上生物量秤了出來
研究問題
這篇想回答 GEDI 太空光達離散的光斑該怎麼抽取與內插,再搭配機器學習,才能在區域尺度準確估算森林地上生物量。
材料與方法
作者在雲南香格里拉用 GEDI Level 2B Version 2 產品,萃取 14 個參數,配 138 個雲杉冷杉樣地的森林資源調查資料算出 AGB。他們以每 10、30、50、70、100 shots 的間隔抽取代表性光斑,用反距離權重內插把光斑回波指標展延成連續面,再挑相關性最高的前五個變數,分別餵給支援向量機、K 近鄰與隨機森林,並用十折交叉驗證比精度。
結論
結論是光斑越少、分布越分散,內插越平滑、精度越高,以每 100 shots 抽出的 1309 個光斑最好;三種模型裡隨機森林最準,R2 達 0.87,全區雲杉冷杉平均地上生物量約 101.98 t/hm2,總量約 3035.29×10^4 t/hm2,和既有森林資源調查結果接近。
討論與我的觀察
這個結果對我很有用,因為它把離散 GEDI 光斑轉成連續生物量面的流程講得很具體,正好對應森林數位孿生中層從資料到資訊的那一段。值得注意的是它的反直覺發現,光斑不是越多越好,這只成立在反距離權重這種地統計內插上,不能推廣到所有 GEDI 方法。限制也很實在,它只用三個品質旗標濾光斑,沒排除建物低雲與非植被地形,也沒做約 10.2 m 的地理定位校正,而且密林穿透有限可能造成高值低估。對我研究的關係上,它支撐我在博論與 review 的光達章節主張,說明稀疏太空光達樣本如何透過地統計加機器學習變成全覆蓋的生物量產品。
重要科學發現
- 原文 Section 4.4 與 Table 4 顯示,內插精度隨光斑取樣密度下降而提升,以每 100 shots 抽取效果最佳。
- 原文 Section 4.6 指出隨機森林精度最高,R2 為 0.87、RMSE 為 30.96 t/hm2、MAE 為 23.65 t/hm2,優於 KNN 與 SVM。
- 原文 Section 4.5 指出 rg 與 pai 與生物量相關性最高,相關係數分別為 -0.236 與 0.224,於 0.01 水準顯著。
關鍵短引用
預測精度隨光斑數量減少而提升Sec 4.4
隨機森林估算精度較高 R2 為 0.87Sec 4.6
博士生的話
這篇給我一條可複製的 GEDI 到 AGB 流程,支撐博論把太空光達放進數位孿生中層;對 TJFS review 則提供光達取樣密度與 RF 對 KNN 對 SVM 模型選擇的實證依據。要注意原文結果與討論對 RF 的 R2 出現 0.87 與 0.88 兩個值,引用前先以 0.87 為準並標待查。