替代指數(Surrogate Index)
2026-08-07
替代指數的概念
在 Athey et al. (2025) 中, 作者提出了替代指數(surrogate index)的概念。
設想我們有機會利用隨機實驗, 也就是把樣本隨機分派到實驗組與控制組, 來評估一個職訓計畫的效果。 我們可以觀察到一些短期的收入、 就業率等結果; 我們同樣想知道這個計畫對長期收入的影響, 可是執行長期追蹤的成本很高, 實驗可能還沒有等到長期結果實現就已經結束了。 如果我們有另一筆觀察性資料, 可能來自行政資料或長期追蹤調查, 而且這筆資料同時包含短期與長期結果, 那麼這筆資料在什麼條件下可以幫助我們估計實驗的長期效果呢?
令實驗分派為 \(A \in \{0,1\}\), 短期結果為 \(S\), 長期結果為 \(Y\), 而我們所觀察到的樣本來自實驗資料(\(G = \text{E}\)) 或觀察性資料(\(G = \text{O}\))。 Athey et al. (2025) 告訴我們, 我們首先可以利用觀察性資料來學習 \(S\) 與 \(Y\) 的關係, 例如跑一個 \(Y\) 對 \(S\) 的迴歸, 並利用這個關係建構所謂的替代指數(surrogate index)。 接下來, 我們利用這個替代指數, 預測實驗中每個人所缺失的長期結果 \(Y\), 然後再利用這些預測值來估計實驗的長期效果。
問題 1:未觀測到的干擾因子
這個方法實作起來很簡單, 可是有時候並不可靠。 例如, 若存在一個未觀察到的干擾因子 \(U\), 如個人的天賦, 會同時正向影響短期收入 \(S\) 與長期收入 \(Y\), 那麼當我們在觀察性資料中學習替代指數時, 我們學到的就不只是 \(S\) 與 \(Y\) 之間由因果關係所產生的關聯, 還包含了由 \(U\) 所造成的 \(S \leftarrow U \rightarrow Y\) 的關聯。
這會有什麼問題呢? 假設職訓計畫會正向影響短期收入 \(S\)。 對於一個實驗組樣本而言, 如果他的短期收入 \(S\) 與另一個控制組樣本相同, 那麼這很可能意味著, 該實驗組樣本的天賦 \(U\) 比控制組樣本低。 因此, 即使兩人的短期收入相同, 實驗組樣本的長期收入 \(Y\) 仍可能比較低。 可是當我們利用觀察性資料學到的替代指數來預測實驗中每個人的長期收入時, 我們會把所有擁有相同短期收入 \(S\) 的人都預測成相同的長期收入 \(Y\)。 如此一來, 我們就會高估實驗組相對於控制組的長期結果, 進而高估職訓計畫對長期收入的效果。
問題 2:未觀測到的短期結果
除此之外, 即使短期結果 \(S\) 與長期結果 \(Y\) 之間不存在未觀察到的干擾因子, 而且 \(S\) 的確能夠完全中介職訓計畫對長期收入的效果, 我們仍然可能遇到另一個問題: 我們未必能夠直接觀察真正的短期結果 \(S\), 而可能只能觀察到與 \(S\) 有關的代理變數 \(W\)。
例如, 先不考慮兩個不同來源資料之間的結合問題, 而考慮以下的線性結構方程模型: \[ \begin{aligned} S &= \gamma A + \varepsilon_S, \\ W &= S + \varepsilon_W, \\ Y &= \beta S + \varepsilon_Y. \end{aligned} \] 其中, \(\varepsilon_S\)、 \(\varepsilon_W\) 與 \(\varepsilon_Y\) 是互相獨立的誤差項。 我們關心的是 \(A\) 對 \(Y\) 的效果 \(\tau \equiv \beta\gamma\)。
假如我們看得到 \(S\), 那麼我們可以直接利用 \(Y\) 對 \(S\) 做線性投影, 得到係數 \(\beta\)。 另一方面, 隨機實驗可以告訴我們 \(A\) 對 \(S\) 的效果為 \(\gamma\)。 因此, 把這兩個關係接起來, 就可以估得實驗的長期效果 \(\tau\)。
可是, 如果我們看不到真正的 \(S\), 而只是單純把代理變數 \(W\) 當成 \(S\) 來使用, 情況就不同了。 如果我們在觀察性資料中以 \(Y\) 對 \(W\) 做線性投影, 那麼會得到 \[ \mathcal{P}(Y \mid W) = \beta \frac{\sigma_S^2} {\sigma_S^2+\sigma_{\varepsilon_W}^2} W, \] 其中, \(\sigma_S^2\) 與 \(\sigma_{\varepsilon_W}^2\) 分別表示 \(S\) 與 \(\varepsilon_W\) 的變異數。
這就是典型的測量誤差問題。 \(W\) 的變動一部分來自真正的短期結果 \(S\), 另一部分則只是來自測量誤差 \(\varepsilon_W\)。 可是只有前者與長期結果 \(Y\) 有關。 因此, 如果直接用 \(Y\) 對 \(W\) 做迴歸, 迴歸係數就會向零衰減(attenuate): 當 \(\sigma_{\varepsilon_W}^2\) 越大時, 迴歸係數就會越小。
另一方面, 由於 \(A\) 是隨機分派的, 而且 \(\varepsilon_W\) 的平均數不會因為實驗分派而改變, 所以實驗仍然可以正確估計 \(A\) 對 \(W\) 的效果 \(\gamma\)。
因此, 如果我們像一般的替代指數一樣, 先在觀察性資料中用 \(Y\) 對 \(W\) 的迴歸來建構替代指數, 再把它帶回實驗資料, 最後得到的效果會是 \[ \beta \frac{\sigma_S^2} {\sigma_S^2+\sigma_{\varepsilon_W}^2} \gamma. \] 相較於真正的長期效果 \(\beta\gamma\), 這個長期效果估計值會因為 \(W\) 的測量誤差而向零衰減。
一個解方
但是, 如果除了 \(W\) 之外, 我們還有另一個對 \(S\) 的代理變數 \(Z\), 事情就不一樣了。 假設我們另外觀察到 \[ Z=S+\varepsilon_Z, \] 其中, \(\varepsilon_Z\) 與前面的誤差項互相獨立。 在觀察性資料中, 我們可以利用兩階段最小平方法(two-stage least squares, 2SLS)來估計 \(\beta\)。 首先把 \(W\) 對 \(Z\) 做線性投影, 再把 \(Y\) 對上一步的預測值做線性投影, 然後我們可以得到 \(W\) 對 \(Y\) 的 2SLS 估計量為: \[ \frac{\operatorname{Cov}(Z,Y)} {\operatorname{Cov}(Z,W)} = \beta. \] 直觀上, \(W\) 可以看成是真正的訊號 \(S\) 加上一個測量誤差。 因為\(Z\) 與 \(W\) 之間共同的變動只來自 \(S\)。 利用 \(Z\) 作為工具變數, 我們等於只利用 \(W\) 中真正反映 \(S\) 的那部分變動, 來學習它與 \(Y\) 的關係。 於是回到實驗資料, 我們又可以利用隨機實驗估計 \(A\) 對 \(W\) 的效果 \(\gamma\)。 於是, 我們就能夠得到正確的長期效果估計值。