機器學習量化的業界現況與心得
因子與收益的非線性關係
我一再強調的是,因子與收益之間的關係,從來就不是線性的。
你拿動量因子舉例:中段的股票,動量值在 ±1σ 之間,其實幾乎沒有預測力,信號接近噪音。真正有信息量的,是兩端。那些動量極強或極弱的股票。線性模型被迫用一條直線去擬合整個截面,結果就是中段稀釋了尾部的真實信號。GBDT 不一樣,它天然可以「中段躺平、尾部發力」,分段捕捉非線性關係,這正是它在截面預測上系統性勝出的原因。
學術與業界證據
Gu、Kelly 和 Xiu 在 2020 年的那篇 RFS 論文把這件事說清楚了:在美股截面收益預測上,機器學習方法整體優於傳統線性模型,而 GBDT 類方法的表現尤其穩定。A 股的情況更明顯,市場結構更不穩定、散戶行為更非線性,樹模型的優勢反而更突出。現在頭部量化私募的主力模型,大部分都是 LightGBM 或 XGBoost 的某個變體,這已經是業界公開的秘密。
GBDT的陷阱
但這裡有個陷阱,很多人沒注意到。
GBDT 對特徵工程的容忍度高,缺失值、量綱、極端值它都能處理,這讓人容易放鬆警惕。問題在於標籤。如果你用原始收益率作為訓練目標,你實際上在讓模型學習「預測大盤漲跌」,但不是「選出相對強的股票」。業界常見做法是….(patreon會講)
時間切分也是。金融數據的時序結構不允許你用隨機切分做交叉驗證,必須嚴格按時間切 train/valid/test,滾動訓練。我見過不少人在這裡犯錯,回測 IC 漂亮,一上線就崩,原因往往就是訓練集洩漏了未來信息。
深度學習的定位
那深度學習呢?
MLP、GRU、Transformer,這些模型在某些場景確實有用,但它們在截面預測上很難穩定打敗 GBDT,原因是金融數據的信噪比實在太低,R² 通常在 1% 左右。深度網絡的表達能力在這種環境下反而成了負擔,過擬合的風險遠高於收益。實際上業界更常見的用法,是把 GRU 或 Transformer 用在時序建模上,直接吃原始量價序列,跳過手工因子,學出端到端的表征。這是另一個方向,並不是替代 GBDT,是作邊際補充。
Ensemble:工業解法
Ensemble才是真正的工業解法。把 GBDT 的輸出和深度模型的輸出做簡單平均,幾乎總是優於任何單一模型。這不是玄學,是方差縮減的統計效果。多個中等模型的平均,比一個精調的大模型更穩健,尤其在市場結構發生漂移的時候。
市場漂移與模型維護
說到漂移,這是截面模型最難處理的問題之一。市場風格切換快,小盤/大盤、成長/價值的輪動週期有時短到幾個月。一個在 2022 年訓練的模型,到 2023 年底可能已經完全失效。業界的標準做法是每一到三個月滾動重訓,把模型當消耗品而不是資產。這個認知很重要,我們不是在建一個「永久有效的預測機器」,我們是要維護一個需要持續更新的信號生產系統。
實戰層面:換手率與成本
還有一個實戰層面的問題:模型輸出的是預測收益排序,但真正決定策略 Sharpe 的,是這個排序在扣除交易成本之後還剩多少。換手率高的模型,毛 IC 再好也可能虧錢。A 股雙邊千三的成本不是小數,一個年化換手超過 1000% 的截面模型,需要相當高的 IC 才能覆蓋成本。所以在組合優化層面加入換手懲罰項,讓優化器自己決定「信號夠強才換倉」,是比事後截斷換手更優雅的解法。
業界競爭焦點的轉移
我的觀察是,現在業界的競爭已經不在模型架構上了。LightGBM 的調參空間大家都摸得差不多,深度模型的結構也趨於收斂。真正的差異化,在因子庫的廣度與質量,在數據清洗的嚴謹程度,在越來越重要的另類數據,在端到端技術以及LLM的運用上。
原文出處:voltima_quant (@voltima_quant) 於 Threads · 查看原文

