基於機器學習之新疆不同森林類型地上生物量遙感估算Remote sensing estimation of aboveground biomass of different forest types in Xinjiang based on machine learning
森林數位孿生方法平台
想知道機器學習在大尺度森林生物量估算到底誰最強,這篇在新疆把 SVM、XGBoost、隨機森林一次比給我看
研究問題
這篇想回答的是,在地形複雜又缺地面樣本的新疆乾旱區,怎麼結合遙感與森林調查資料,靠機器學習和森林類型分層,做出省級尺度的地上生物量估算與製圖。
材料與方法
作者先用連續生物量擴展係數法 CBEF 把 1335 個樣點的材積換算成 AGB,再用 Boruta 演算法從 70 個候選因子裡篩變數,各森林類型取前 12 個重要特徵,資料以 7:3 切訓練與驗證,分別建立 SVM、XGBoost、RF 三種模型,全程用 R 語言實作,並針對常綠針葉林、落葉針葉林、落葉闊葉林與混交林四種類型分開建模。
結論
三種模型裡隨機森林最準也最穩,四種森林類型的 R2 都大於 0.65,而且分森林類型建模明顯比不分類型的全樣本模型準;新疆森林平均 AGB 約 152 Mg/hm2,空間上高山高、平原低,高值集中在天山、阿爾泰與崑崙三大山系。
討論與我的觀察
對我來說這篇最有用的是它用實證把分森林類型建模能提升精度這件事講清楚,溫度和 DEM 在所有模型都被選為關鍵特徵也很值得記。限制也很實在,它用的是 2011 年的清查資料時效性受限,CBEF 法基於全國資料對乾旱區可能有偏差,高 AGB 區還有遙感飽和問題。我自己核對時發現原文 DBF 平均 AGB 同時出現 83.74 和 63.74 兩個數字,這點要回原文釐清才能精確引用。跟我研究的關係上,它的 Boruta 加隨機森林、分型建模的流程很值得借鏡到台灣,但乾旱區樹種和台灣亞熱帶森林不同,不能直接套用精度。
重要科學發現
- 原文指出隨機森林在三種模型中最準,四種森林類型 R2 皆大於 0.65,RMSE 介於 30.59 至 60.46 Mg/hm2。
- 原文指出不分森林類型的全樣本模型精度最低 R2 僅 0.57,分型建模能顯著提升估算精度。
- 原文指出新疆森林平均 AGB 為 152.01 Mg/hm2,且溫度與 DEM 在所有模型皆被選為特徵變數。
關鍵短引用
RF 顯著提升森林 AGB 估算精度p.1 Abstract
分森林類型顯著提升估算精度p.12 Conclusion (2)
博士生的話
這篇支撐我博論在機器學習估算 AGB 時採森林類型分層與 RF 為主力的方法選擇;對 TJFS review,它是 Ch5 機器學習章節三模型實證比較與分型提升精度的具體案例錨點。