讓新聞為股價定價:從情緒雜訊到主題因果的量化解碼-閱讀筆記與批判性反思
一般分享作者:陳昱嘉
內文:
內文:
論文:Modeling and Optimization of News-Stock Price Correlation Based on Topic Influence Selection
作者:Huaxi Liu, Zonghan Jiang, Desheng Li, Lin Gao, Kun Wang
發表:IEEE Access, vol. 13, 2025 (pp. 196127–196142)
DOI / 連結:10.1109/ACCESS.2025.3631665
一、單一情緒指標在真實市場的失靈
想像一下當開發的量化交易系統發出做多信號:「今天社群新聞情緒一片樂觀,為什麼大盤開盤卻迎來重挫?」
回頭翻查資料才發現,當天社群熱搜充斥著好萊塢電影大賣、體育賽事奪冠等熱門正面消息,系統算出來的「大盤總體情緒分數」高達 0.85;然而,真正主導當天行情的,是一條版面不大、語氣看似平淡的財經快訊:「聯準會暗示加速縮表與升息節奏」。
這正是傳統新聞情感分析的盲點:把所有文本混為一談計算情緒總分,但「情緒正面」不等於「具備資產定價權」。不同主題的新聞對市場的衝擊力道與消化時滯截然不同,這就是新聞的「主題異質性(Topic Heterogeneity)」。
「本篇論文的核心突破:將籠統的情緒總分,拆解為『主題 x 極性』的因果顯著性矩陣。
新聞不只是文字的情緒極性,更要看它是什麼主題、延遲幾天吸收,以及在統計因果上是否真能推動價格走勢。」
二、七大主題與三種情緒的交互映射
論文不再使用單一分數,而是將每日熱門新聞劃分為 7 大主題 與 3 種情緒極性,形成 7x3 = 21 種交集維度:
主題維度 | 涵蓋範疇與標題範例 | 傳統認知 vs. 本篇實證發現 |
|---|---|---|
Politics(政治) | 國際地緣衝突、監管政策、首長選舉 | 原以為政策消化緩慢,實測證實在近期(2018–2023)加速至 Lag 1 天內即時定價。 |
Health(醫療衛生) | 疫情動態、公衛防護、藥品法規核准 | 過去常被當作冷門因子,在 2018–2023 年躍升為主導短期與長期的關鍵力量。 |
Entertainment(娛樂) | 影星緋聞、八卦醜聞、娛樂圈動態 | 2008–2016 曾是預測力最強的核心因子,但到 2018–2023 預測力徹底歸零。 |
Technology(科技) | 晶片製造、AI 突破、通訊技術發布 | 因果影響多集中在 Lag 2 天前後,呈現穩定的中期波段反應。 |
Business(商業) | 企業營收財報、併購重組、供應鏈斷裂 | 正面商業情緒在 Lag 1 具顯著集中性,容易被市場即時吸收。 |
Science / Sports(科學/體育) | 基礎科研探索、國際賽事勝負 | 預測因果性極弱,大部分在計量檢定中直接被作為雜訊過濾。 |
註:主題和情緒必須拆開解構。娛樂新聞的恐慌不代表總體經濟衰退;不同主題在歷史上的消化週期完全不同,不能用單一衰減率一概而論。
三、端到端四階段工程管線
圖片來源:Liu, H., Jiang, Z., Li, D., Gao, L., and Wang, K. (2025). Modeling and Optimization of News-Stock Price Correlation Based on Topic Influence Selection. IEEE Access, vol. 13, p. 196129
(配圖說明:展示新聞標題如何透過主題分類與情緒分析,交叉輸出 21 維特徵序列,再經 ADF / Granger 檢定後轉化為回測倉位)
架構由四個高度解耦的模組依序串接而成:
主題分類模組(寫入過濾):新聞標題先做 Lowercase、Punkt 斷詞、去停用詞與 Stemming 詞幹提取,利用 TF-IDF 與隨機森林快速分為 7 類。
語意情緒模組(實體感知):以微調後的 FinBERT 提取 [CLS] 向量,輸出情緒機率並統計每日篇數,合成 21 個計數序列。
因果降噪模組(計量剪枝):先跑 ADF 檢定確認序列平穩,再跑 1~3 天與 1~7 天的 Granger 因果檢定,只留下具備統計預測力的因子。
交易回測模組(執行控制):以負對數 p 值算權重,搭配滾動 Z-Score 捕捉「衝擊意外度」,以 tanh 產生連續倉位控制曝險。
圖片來源:Liu, H., Jiang, Z., Li, D., Gao, L., and Wang, K. (2025). Modeling and Optimization of News-Stock Price Correlation Based on Topic Influence Selection. IEEE Access, vol. 13, p. 196134
(配圖說明:展示 FinBERT 的 Entity-Aware Attention 遮罩與 Task-specific 輸出層結構)
四、驅動策略運作的關鍵公式
4.1 解決資料失衡:類別反比損失權重
針對金融語料中「中性事實陳述遠多於正負面情緒」的樣本失衡,作者在交叉熵損失函數中引入反比加權係數:
公式解讀:M 為總樣本數,Class = 3(正/中/負),n_i 為第 i 類的樣本數量。樣本數越少的少數類別(正負向),其損失權重 W_i 就越大,迫使 FinBERT 不能投機取巧全猜中性,成功讓測試集準確率從 93% 躍升至 98%。
4.2 消除人為偏見:統計因果證據賦權
論文摒棄人為拍腦袋給權重的主觀性,直接讓 Granger 因果檢定的顯著性證據決定因子權重:
公式解讀:p-value 越小代表越顯著,取負對數 -log(p) 之後數值反而越大。若某主題在 Lag 1~3 天持續顯著,累加出的強度 S_c 就會極高;經歸一化後的靜態權重 W_c 讓統計數據直接主導投資組合。
4.3 捕捉突發衝擊:標準化信號與平滑倉位
如何把每天各主題的新聞篇數,轉化為平滑且具備風控能力的部位比例?
公式解讀:z̃ₜ⁽ᶜ⁾ 是各主題篇數增量 ΔXₜ 經 63 天滾動窗口算出的 Z-score(截斷於 [−3, 3]),專注衡量新聞的「意外程度」。部位透過 tanh 限制在 [−1, 1] 之間,且嚴格執行「t−1 日收盤算信號、t 日開盤建倉」以防止未來資訊洩漏(No Data Leakage)。
五、實證對照:跨週期的市場反應大位移
5.1 短標題任務的模型選型:隨機森林勝出
在近 20 萬筆新聞標題的分類實驗中,傳統機器學習展現了驚人的抗噪性:
評估模型 | 整體平均 Accuracy | Health F1 | Politics F1 | Technology F1 | 實務分析解讀 |
|---|---|---|---|---|---|
Random Forest (本文選用) | .88 | .87 | .89 | .90 | 短文本詞頻特徵集中,搭配類別加權不易過擬合 |
BERT Baseline | .84 | .83 | .86 | .81 | 參數量龐大,在極短文本上容易因稀疏而擬合過度 |
5.2 跨越十年的市場反應時滯:魚骨圖的結構巨變
2008–2016 週期(早期):Entertainment Negative(負面娛樂)貫穿 Lag 1~3 天所有魚刺,是早期的絕對主導因子;且多數實質因子(醫療、政治)均掛在 Lag 3,市場消化相當緩慢。
2018–2023 週期(近期):負面娛樂在魚骨圖中徹底消失,而政治與醫療在 Lag 1(第 1 天) 密集爆發,證明市場消化資訊的週期大幅壓縮。
5.3 量化回測表現:全面戰勝買入持有基準
歷史測試週期 | 投資策略 | 年化報酬率 (Return) | 夏普比率 (Sharpe) | 最大回撤 (MDD) |
|---|---|---|---|---|
2008–2016 | 多因子倉位策略 | 13.81% | 0.5978 | 57.66% |
Buy & Hold DJIA (基準) | 5.48% | 0.3661 | 44.43% | |
2018–2023 | 多因子倉位策略 | 21.86% | 1.1379 | 18.80% |
Buy & Hold DJIA (基準) | 7.61% | 0.4488 | 37.09% |
測試滯後期 | 2008–2016 年化報酬 | 2008–2016 夏普比率 | 2018–2023 年化報酬 | 2018–2023 夏普比率 |
|---|---|---|---|---|
Lag 1 day | 10.57% | 0.4619 | 29.44% (最優) | 0.9894 |
Lag 2 day | 5.10% | 0.3162 | -9.36% | -0.1071 |
Lag 3 day | 20.20% (最優) | 0.7848 | 3.00% | 0.2524 |
滯後期最佳化驗證:
2008–2016:Lag 3 表現最優(年化達 20.20%,夏普 0.7848)。
2018–2023:Lag 1 躍升為最優(年化達 29.44%,夏普 0.9894)。
回測數據從真實資金報酬層面,完全驗證了市場資訊吸收窗口從 3 天加速到 24 小時以內的計量結論。
六、心得與未來落地取捨
6.1 本篇論文中最好的設計是什麼?
讀完這篇論文,我個人最欣賞、認為值得借鏡的,並不是作者把 FinBERT 準確率微調到 98%,而是把「非結構化語意表徵」與「計量統計控制」徹底解耦的架構設計思維:
表示層(Representation Layer):由隨機森林與 FinBERT 負責,將複雜且充滿雜訊的新聞文字,投影並標準化為每日 7 x 3 = 21 維度的主題情緒計數。
控制層(Control Layer):由 ADF 檢定與 Granger 因果檢定負責。系統不盲目相信深度學習吐出的情緒機率,而是引入統計假設檢定作為第一道防線,嚴格篩選出真正對股價有「預測因果力」的主題,再透過滾動 Z-Score 衝擊量化與 tanh 函數約束交易曝險。
讓管線的每一層都可以獨立進化,而不會引發骨牌效應。
這種把「文本特徵萃取」與「統計因果濾波」分開的做法,比許多論文將所有文字向量直接丟進黑盒子神經網絡做端到端回歸,更具備可解釋性與除錯便利性。
6.2 值得深入參考借鑑的亮點設計與巧思
除了宏觀的架構外,在細部模組實作上有幾個細節極具參考價值:
統計因果顯著性自動賦權機制:
傳統量化模型在給定多因子權重時,往往依賴人工主觀設定或容易過擬合的多元回歸。本文利用公式 (11) 將計量假設檢定的顯著性直接、平滑地轉換為客觀的因子權重 。p 值越小、跨期連續顯著的主題,權重自然越大,實現了「讓計量數據客觀決定因數重要性」。
實體感知注意力機制:
在金融領域中,短標題的情緒詞往往需要依附特定主體。作者透過 SpaCy 抽取股票代碼、機構名與貨幣數額等關鍵實體,並直接在 Transformer 的 Self-Attention 遮罩矩陣中進行加權,引導模型將注意力集中在關鍵金融實體上,成功防止情緒詞與核心標的脫鉤。
嚴格的執行時序防禦(No Data Leakage):
量化論文容易犯的錯誤就是未來資訊洩漏。本篇在文中明確規範:t-1 日收盤由新聞計算出的部位信號,強制遞延至第 t 日開盤時才執行交易。這種在程式執行時序上的自我約束,確保了回測績效並非來自當日盤中資料的偷看。
6.3 文中未言明的盲點
順著論文的資料流從文字前處理、特徵工程一直檢驗到交易回測時,我也發現了幾個作者輕描淡寫、但實務上影響甚鉅的潛在問題:
事件深度被極度閹割(篇數不等於衝擊強度):
論文僅用 SpaCy 辨識出實體字串做 Attention Masking,並在下游統計「每日新聞篇數(Count)」。這意味著「小公司被罰款」與「雷曼兄弟倒閉」在模型眼中被視為同等篇數權重,完全遺失了事件嚴重度。
完全架空的零交易摩擦假設:
策略每日透過 tanh(S_t) 平滑調整倉位,代表投資組合每天都在微調部位(換手率極高)。然而回測公式 (15) 卻直接用部位乘上指數漲跌,沒有扣除券商手續費、借券賣空利息與市場滑價。在每天部位變動的情況下,摩擦成本將大幅侵蝕帳面上的超額報酬。
6.4 我的取捨:如果未來要實作或參考,該如何繼承與調整?
綜合上述優缺點,採取以下原則:
保留「因果統計賦權」,但改採「滾動擴展視窗(Rolling Expanding Window)」:
改為每一交易日僅用過去歷史回顧視窗動態重跑檢定與更新權重,確保杜絕前視偏差,打造真正能在實盤生存的模型。
擴充資料來源,跨出單一論壇框架:
正如作者在結尾提到的關鍵限制,本篇資料僅取自 2023 年之前的 Reddit 單一文字論壇。但在 2024–2026 年的今天,TikTok、YouTube Shorts 等短影音媒介,以及生成式 AI 演算法推薦流早已迅速顛覆散戶接收資訊的生態。因此我會將資料源擴充為「社群多模態傳播熱度指標」,透過比對機構專業資訊與社群大眾情緒的傳播時滯差異,構建出更貼近當代多模態資訊環境的動態定價模型。
加入真實交易摩擦與借券成本:
唯有在扣除真實交易摩擦後仍能維持正向夏普比率的策略,才具備真正的實用學術價值。
七、來源與資料說明
本文表格與圖表數據均為論文報告值,未獨立重現。
原始論文出處:
Liu, H., Jiang, Z., Li, D., Gao, L., & Wang, K. (2025). Modeling and Optimization of News-Stock Price Correlation Based on Topic Influence Selection. IEEE Access, vol. 13, pp. 196127–196142。
[論文架構:Figure 1;模型細節:Figure 2;公式:Eq. (4), (9)–(11), (15);模型選型:Table 5 & 6;回測績效:Table 7–10;長短期因果:Figure 8–10;淨值走勢:Figure 11 & 12]