現(xiàn)Transformer時間序列預(yù)測:從單步到多步的完整指南)
簡介本資源是一套基于PyTorch實(shí)現(xiàn)的Transformer時間序列預(yù)測完整實(shí)驗(yàn)方案面向機(jī)器學(xué)習(xí)初學(xué)者與時間序列建模實(shí)踐者聚焦單步與多步預(yù)測兩大核心任務(wù)適用于氣象、能源、金融等領(lǐng)域的時序數(shù)據(jù)分析場景。壓縮包共10個文件3.21MB包含2個核心訓(xùn)練腳本transformer-singlestep.py與transformer-multistep.py、1個真實(shí)溫度數(shù)據(jù)集daily-min-temperatures.csv、1張預(yù)測效果可視化圖transformer-future200.png、1個動態(tài)訓(xùn)練過程演示gifresult.gif、1份環(huán)境依賴說明requirements.txt及README文檔等結(jié)構(gòu)清晰、開箱即用。已有2909人學(xué)習(xí)下載所有代碼均經(jīng)實(shí)測可直接運(yùn)行附帶每日最低溫度數(shù)據(jù)上的100輪訓(xùn)練結(jié)果與多步預(yù)測對比分析便于讀者理解模型輸入構(gòu)造、位置編碼設(shè)計、掩碼機(jī)制應(yīng)用及輸出解碼邏輯是深入掌握Transformer在時序領(lǐng)域落地的優(yōu)質(zhì)實(shí)踐素材。 拿到一個時間序列預(yù)測需求時很多人第一反應(yīng)是先套LSTM。我一開始也是這么干的但項目數(shù)據(jù)拉長到幾百個時間步后LSTM訓(xùn)練慢不說往后預(yù)測的曲線像一個被壓扁的彈簧越來越“平”。朋友建議試試Transformer我?guī)е鴮⑿艑⒁傻膽B(tài)度用Pytorch從零搭了一套單步和多步預(yù)測實(shí)驗(yàn)。沒想到的是模型把長距離依賴抓得很穩(wěn)預(yù)測結(jié)果比LSTM明顯更貼合趨勢。這篇文章就是這次實(shí)驗(yàn)的記錄從為什么選Transformer、單步/多步怎么設(shè)計到Pytorch完整實(shí)現(xiàn)和踩坑實(shí)錄都會拆開講。適合已經(jīng)會上手Pytorch、但還沒用Transformer處理過時間序列的同學(xué)也適合做量化、銷量預(yù)測、設(shè)備監(jiān)測等場景的工程師參考。我會盡量把每個關(guān)鍵選擇背后的原因?qū)懬宄皇侵粊G代碼。1. 整體設(shè)計與思路拆解1.1 為什么用Transformer而不是LSTM在時間序列上做預(yù)測本質(zhì)上是在建模“過去的時間點(diǎn)如何影響未來”。LSTM和GRU的思路是遞歸地、逐步地把信息往后傳這種過程的優(yōu)點(diǎn)是參數(shù)少、可解釋性強(qiáng)但缺點(diǎn)也很明顯訓(xùn)練是串行的序列一長梯度消失和長期依賴丟失的問題就會顯現(xiàn)。Transformer的設(shè)計是直接計算序列中任意兩個位置之間的關(guān)聯(lián)度通過多頭注意力機(jī)制一次性看到全局信息。放在時間序列里這就意味著模型可以自己學(xué)會“第1個時間點(diǎn)對第50個時間點(diǎn)很重要”而不是像RNN那樣靠門控一路“背”過去。不過話說回來Transformer也不是沒有代價。它不像LSTM自帶順序概念必須靠位置編碼把順序信息硬塞進(jìn)輸入而且注意力矩陣的空間復(fù)雜度是O(n^2)窗口特別長的時候會吃顯存。這決定了我們在實(shí)驗(yàn)里不能無腦堆窗口需要在數(shù)據(jù)長度和模型容量之間做取舍。但總體上對于中等長度幾十到幾百個時間點(diǎn)的時間序列Transformer的精度和訓(xùn)練效率都很有競爭力。我在做實(shí)驗(yàn)對比時同一個數(shù)據(jù)切了兩份一份用兩層LSTM一份用兩層Transformer encoder。LSTM訓(xùn)練了接近200個epoch才收斂Transformer在100個epoch左右就已經(jīng)更好了尤其在后半段的預(yù)測曲線上Transformer更貼近原始趨勢。這其實(shí)不難理解時間序列里“之前一段時間的形態(tài)”往往比“最后一個點(diǎn)的值”更重要而注意力機(jī)制天生擅長捕捉這種形態(tài)。1.2 單步預(yù)測和多步預(yù)測的差異單步預(yù)測是經(jīng)典的監(jiān)督學(xué)習(xí)任務(wù)輸入過去一段序列輸出下一個時間點(diǎn)的值。多步預(yù)測的難度要高一個檔次因?yàn)檩敵龅氖且粋€連續(xù)的未來區(qū)間不只是“下一個點(diǎn)”的精確值還要考慮未來多個點(diǎn)之間的疊加誤差。我在實(shí)驗(yàn)中分別實(shí)現(xiàn)了兩種多步方案這里先做一個直觀對比指標(biāo)直接多步遞歸多步實(shí)現(xiàn)復(fù)雜度輸出層維度設(shè)為horizon簡單需要把預(yù)測值拼回輸入循環(huán)推理推理速度快一次forward得到K個點(diǎn)慢要連續(xù)forward K次誤差累積幾乎沒有因?yàn)镵個點(diǎn)同時輸出明顯越往后越偏訓(xùn)練難度需要同時擬合K個標(biāo)簽數(shù)據(jù)量小時難度大訓(xùn)練時仍是單步難度低適用場景horizon較大、訓(xùn)練數(shù)據(jù)充足小規(guī)模快速實(shí)驗(yàn)、模型迭代期直接多步Direct Multi-stepTransformer輸出層的維度直接設(shè)為horizon長度讓模型一次生成未來K個點(diǎn)。缺點(diǎn)是模型要同時擬合K個輸出訓(xùn)練難度高但推理快。遞歸多步Recursive Multi-step先用單步模型預(yù)測出下一個點(diǎn)再把這個預(yù)測值當(dāng)輸入滑進(jìn)窗口繼續(xù)預(yù)測下下個點(diǎn)。實(shí)現(xiàn)簡單但誤差會隨著步數(shù)累積越往后越偏。還有一種Teacher Forcing的訓(xùn)練方式只在訓(xùn)練時用真實(shí)值替代預(yù)測值喂養(yǎng)模型推理時再用預(yù)測值這個后面在訓(xùn)練循環(huán)里會講。這兩個方案我都跑了也記錄了各自的loss曲線和誤差指標(biāo)。直接多步在horizon比較大時會比遞歸更穩(wěn)但前提是訓(xùn)練數(shù)據(jù)要充足遞歸多步在小樣本上更靈活適合快速迭代。建議你在自己的數(shù)據(jù)上都試試對比后再選。2. 核心細(xì)節(jié)解析與實(shí)操要點(diǎn)2.1 位置編碼不能省但不要照搬NLPTransformer本身沒有順序感。把序列順序打亂注意力算出來的結(jié)果是一模一樣的。所以位置編碼是Transformer做時序預(yù)測繞不開的基礎(chǔ)。NLP里常見的是正弦位置編碼把位置索引用sin/cos函數(shù)映射到embedding維度上。在時間序列里這個方式一樣能用但我測試下來直接把時間戳比如間隔、周幾、小時作為額外特征拼進(jìn)輸入效果往往更好尤其是數(shù)據(jù)有明顯周期性的場景。實(shí)用的做法是“加”而不是“拼”把正弦位置編碼加到輸入embedding上然后額外把標(biāo)準(zhǔn)化后的時間特征拼在輸入特征維度后面。這樣模型既能感知絕對位置也能感知周期性信息。代碼實(shí)現(xiàn)時位置編碼的維度要和d_model一致否則維度對不上沒法加。為什么要乘sqrt(d_model)這是Transformer原論文里的一個細(xì)節(jié)。輸入經(jīng)過embedding后數(shù)值范圍通常會比較小直接往上面加位置編碼位置信息很容易蓋過原始特征。乘上sqrt(d_model)相當(dāng)于把輸入embedding放大到和位置編碼一個量級讓兩者在相加時都能保留有效信息。我在實(shí)驗(yàn)里試過不乘這個系數(shù)訓(xùn)練loss收斂明顯變慢所以這個細(xì)節(jié)不建議省。2.2 數(shù)據(jù)預(yù)處理決定模型上限先講一個我踩過的坑一開始我直接用整個序列的均值和方差做歸一化訓(xùn)練loss很漂亮但測試特別差。后來才意識到這是把未來信息透漏給了訓(xùn)練過程也就是典型的數(shù)據(jù)泄漏。正確的做法是只在訓(xùn)練集上fit scaler再用同一套scaler去transform驗(yàn)證集和測試集。滑動窗口的構(gòu)造也值得細(xì)品。單步預(yù)測時每條樣本是[look_back, feature_dim]的輸入和[1]的標(biāo)簽多步預(yù)測時標(biāo)簽就變成[horizon]或者[horizon, feature_dim]。窗口長度look_back一般取序列長度的10%~20%不能太短也不能太長。我常用look_back24或48來預(yù)測未來6~12個點(diǎn)效果比拍腦袋定的窗口好不少。另外如果數(shù)據(jù)有缺失不要用均值填充盡量用前向填充或插值避免引入錯誤的局部趨勢。關(guān)于歸一化我一般用MinMaxScaler。它在數(shù)據(jù)有明顯上下界時非常穩(wěn)能讓模型更快收斂。StandardScaler也不是不行但對異常值更敏感。如果數(shù)據(jù)里有特別大的尖峰MinMax可能把正常值壓得太扁這時候可以先做一輪異常值截斷再用。不要一上來就把所有數(shù)據(jù)丟進(jìn)模型先畫圖看分布這個習(xí)慣能省掉后面很多麻煩。2.3 核心超參數(shù)怎么定才有得跑下面是這次實(shí)驗(yàn)里的核心超參數(shù)可以直接照抄參數(shù)數(shù)值說明d_model64輸入embedding和注意力投影的維度nhead4多頭注意力頭數(shù)需能被d_model整除num_encoder_layers2標(biāo)準(zhǔn)Transformer里encoder層數(shù)我用了2層dim_feedforward256前饋網(wǎng)絡(luò)隱藏層維度dropout0.1防止過擬合batch_size64顯存不大就調(diào)小建議32~128learning_rate1e-3初始學(xué)習(xí)率配合cosine調(diào)度epochs100早停耐心值建議設(shè)20注意nhead一定要能整除d_model否則Pytorch會直接報錯。層數(shù)不是越多越好我試過4層在數(shù)據(jù)量不大的情況下反而更容易過擬合。學(xué)習(xí)率建議用AdamW 余弦退火Transformer對學(xué)習(xí)率比LSTM敏感固定學(xué)習(xí)率容易震蕩。dim_feedforward我習(xí)慣設(shè)成d_model的4倍左右太大參數(shù)量漲得快太小表達(dá)能力受限。還有一個常被忽略的參數(shù)是dropout。時間序列訓(xùn)練數(shù)據(jù)一般不會特別大dropout設(shè)太小容易過擬合設(shè)太大又可能欠擬合。0.1到0.2之間是個安全區(qū)間。如果你的數(shù)據(jù)量超過十幾萬條可以把dropout降到0.05加快收斂。3. 實(shí)操過程與核心環(huán)節(jié)實(shí)現(xiàn)3.1 環(huán)境搭建與項目結(jié)構(gòu)動手前先把環(huán)境理順。我習(xí)慣用conda建一個獨(dú)立環(huán)境避免跟其他項目打架。conda create -n ts_transformer python3.9 -y conda activate ts_transformer pip install torch2.1.2 --index-url https://download.pytorch.org/whl/cu118 pip install numpy pandas matplotlib scikit-learn如果你用的是GPU機(jī)器裝完后第一時間檢查一下CUDA是否可用python -c import torch; print(torch.cuda.is_available(), torch.cuda.device_count())輸出“True 1”就說明Pytorch能用GPU了。如果輸出False不是驅(qū)動問題就是Pytorch版本沒選對。我還在Jetson等嵌入式設(shè)備上裝過那又得單獨(dú)挑適配版本不建議新手一上來就碰。項目目錄我習(xí)慣這樣組織time_series_transformer/ ├── data.csv # 原始數(shù)據(jù) ├── dataset.py # 數(shù)據(jù)集與預(yù)處理工具 ├── model.py # Transformer模型定義 ├── train.py # 單步/多步訓(xùn)練腳本 ├── evaluate.py # 評估與可視化 └── requirements.txt這個結(jié)構(gòu)看著簡單但足夠用。實(shí)驗(yàn)迭代時最怕把所有代碼堆在一個文件里改一個地方牽一發(fā)動全身。把數(shù)據(jù)、模型、訓(xùn)練、評估拆開后面換數(shù)據(jù)集或者換模型會輕松很多。3.2 數(shù)據(jù)準(zhǔn)備與Dataset類為了把實(shí)驗(yàn)說透我用了一段周期信號疊加噪聲的數(shù)據(jù)模擬傳感器讀數(shù)或者銷量曲線。你也可以換成自己的csv只要確保日期列按時間升序排列。import numpy as np import pandas as pd from torch.utils.data import Dataset, DataLoader # 生成示例數(shù)據(jù)正弦 線性趨勢 噪聲 np.random.seed(42) t np.arange(0, 1200) signal 10 * np.sin(2 * np.pi * t / 50) salary t * 0.01 noise np.random.normal(0, 1, sizet.shape) data signal salary noise注意這個數(shù)據(jù)只是示例真正項目里數(shù)據(jù)要復(fù)雜得多但處理和建模邏輯是一樣的。這里我故意加了一個單調(diào)趨勢是想看Transformer能不能在趨勢和周期并存時學(xué)出結(jié)構(gòu)。接下來是滑動窗口。我寫了一個繼承Dataset的類輸入是[look_back, feature_dim]序列標(biāo)簽是未來horizon個點(diǎn)。class TimeSeriesDataset(Dataset): def __init__(self, data, look_back24, horizon6, step1): self.x, self.y [], [] for i in range(0, len(data) - look_back - horizon 1, step): x data[i:i look_back] y data[i look_back:i look_back horizon] self.x.append(x) self.y.append(y) self.x np.array(self.x, dtypenp.float32) self.y np.array(self.y, dtypenp.float32) def __len__(self): return len(self.x) def __getitem__(self, idx): return self.x[idx], self.y[idx]需要注意這里的data是一維數(shù)組所以我構(gòu)建x時每個時間點(diǎn)只有1個特征。如果有多維特征沿著最后一個維度拼接即可上一節(jié)的“拼時間戳”也是在這里做。構(gòu)造好的樣本可以用DataLoader加載look_back, horizon 24, 6 dataset TimeSeriesDataset(data, look_back, horizon) # 按時間順序切分 train_size int(0.7 * len(dataset)) val_size int(0.15 * len(dataset)) test_size len(dataset) - train_size - val_size train_data, val_data, test_data torch.utils.data.random_split( dataset, [train_size, val_size, test_size], generatortorch.Generator().manual_seed(42) )這里要特別提醒random_split會在內(nèi)部做隨機(jī)打亂但因?yàn)槲覀儤?gòu)造樣本時本身就是按時間順序滑動窗口生成的可能不太合適。更穩(wěn)妥的做法是直接按索引切分不調(diào)用random_split具體看你自己需求。如果是嚴(yán)格的時序預(yù)測建議手動切片保證訓(xùn)練集在時間上完全早于驗(yàn)證集和測試集。3.3 Transformer模型核心實(shí)現(xiàn)標(biāo)準(zhǔn)Transformer結(jié)構(gòu)里包含Encoder和Decoder。但時間序列預(yù)測不一定需要Decoder尤其是單步預(yù)測和直接多步預(yù)測用Encoder堆疊后接一個全連接輸出層就能取得不錯的效果。我在實(shí)驗(yàn)中選的是Encoder-only方案結(jié)構(gòu)更輕訓(xùn)練更快。如果想做遞歸多步同樣可以復(fù)用這個Encoder只是在推理時多繞幾圈。下面是完整的模型定義位置編碼和Encoder主體都放進(jìn)去。import torch import torch.nn as nn import math class PositionalEncoding(nn.Module): def __init__(self, d_model, dropout0.1, max_len5000): super().__init__() self.dropout nn.Dropout(pdropout) pe torch.zeros(max_len, d_model) position torch.arange(0, max_len, dtypetorch.float).unsqueeze(1) div_term torch.exp(torch.arange(0, d_model, 2).float() * (-math.log(10000.0) / d_model)) pe[:, 0::2] torch.sin(position * div_term) pe[:, 1::2] torch.cos(position * div_term) pe pe.unsqueeze(0) self.register_buffer(pe, pe) def forward(self, x): x x self.pe[:, :x.size(1), :] return self.dropout(x) class TimeSeriesTransformer(nn.Module): def __init__(self, feature_dim1, d_model64, nhead4, num_layers2, dropout0.1): super().__init__() self.d_model d_model self.input_proj nn.Linear(feature_dim, d_model) self.pos_encoder PositionalEncoding(d_model, dropout) encoder_layer nn.TransformerEncoderLayer( d_modeld_model, nheadnhead, dim_feedforward256, dropoutdropout, batch_firstTrue, ) self.transformer_encoder nn.TransformerEncoder(encoder_layer, num_layersnum_layers) def forward(self, x): # x: [batch, seq_len, feature_dim] x self.input_proj(x) * math.sqrt(self.d_model) x self.pos_encoder(x) x self.transformer_encoder(x) return x在單步任務(wù)里輸出層可以只取編碼序列的最后一幀再接一個Linear。在多步任務(wù)里要么對最后一幀輸出horizon維要么把整個編碼序列壓平再接全連接。后者參數(shù)量大一般用前者class SingleStepHead(nn.Module): def __init__(self, d_model): super().__init__() self.fc nn.Linear(d_model, 1) def forward(self, enc_output): return self.fc(enc_output[:, -1, :]) # 取最后一個位置的編碼 class MultiStepHead(nn.Module): def __init__(self, d_model, horizon): super().__init__() self.fc nn.Linear(d_model, horizon) def forward(self, enc_output): return self.fc(enc_output[:, -1, :])為什么取“最后一個位置的編碼”而不是所有位置的編碼因?yàn)門ransformerEncoder每一層都會做全局注意力也就是說每個位置的輸出都已經(jīng)包含了對整個序列的“總結(jié)”。最后一個位置在時間上離預(yù)測目標(biāo)最近拿它做輸出頭的信息瓶頸最合適。如果要保留更多細(xì)節(jié)也可以把最后幾幀拼起來但代價是參數(shù)量增加收益不一定明顯。3.4 單步預(yù)測訓(xùn)練流程訓(xùn)練循環(huán)本身不復(fù)雜但有幾個地方我會特別注意。第一個是loss單步用MSE這是回歸任務(wù)的標(biāo)配。第二個是優(yōu)化器AdamW配合余弦退火幾乎是當(dāng)前Transformer訓(xùn)練的標(biāo)準(zhǔn)配置比單純用Adam穩(wěn)定。def train_model(model, train_loader, val_loader, epochs50, lr1e-3): device cuda if torch.cuda.is_available() else cpu model model.to(device) criterion nn.MSELoss() optimizer torch.optim.AdamW(model.parameters(), lrlr) scheduler torch.optim.lr_scheduler.CosineAnnealingLR(optimizer, T_maxepochs) for epoch in range(epochs): model.train() train_loss 0.0 for x, y in train_loader: x, y x.to(device), y.to(device) optimizer.zero_grad() enc_out model(x) pred model.output_head(enc_out) loss criterion(pred, y) loss.backward() optimizer.step() train_loss loss.item() scheduler.step() val_loss evaluate(model, val_loader, criterion, device) if (epoch 1) % 10 0: print(fEpoch {epoch1}, Train Loss: {train_loss/len(train_loader):.6f}, Val Loss: {val_loss:.6f}) return model寫這段代碼時要注意model.output_head是我們在外部掛上去的。一個更方便的做法是在TimeSeriesTransformer里增加一個head_type參數(shù)直接在構(gòu)造函數(shù)里決定使用單步頭還是多步頭這樣訓(xùn)練代碼可以共用。訓(xùn)練時如果loss長時間不下降先查兩件事學(xué)習(xí)率是不是太大數(shù)據(jù)有沒有標(biāo)準(zhǔn)化。絕大多數(shù)奇怪現(xiàn)象都出在這兩處。3.5 多步預(yù)測實(shí)現(xiàn)方式直接多步訓(xùn)練起來和單步幾乎一樣只是y的維度從1變成horizon輸出頭換成MultiStepHeadloss仍然用MSE。推理的時候一次拿到的就是未來horizon個點(diǎn)非常直接。遞歸多步需要額外寫一個推理函數(shù)把模型預(yù)測出的下一個值拼到輸入序列尾部同時丟掉最前面的點(diǎn)讓窗口“滑”起來。def recursive_forecast(model, history, steps, devicecpu): # history: [look_back, feature_dim] model.eval() history torch.tensor(history, dtypetorch.float32).unsqueeze(0).to(device) preds [] with torch.no_grad(): for _ in range(steps): enc_out model(history) pred model.output_head(enc_out) # [1, 1] preds.append(pred.item()) pred pred.unsqueeze(-1) # [1, 1, 1] history torch.cat([history[:, 1:, :], pred], dim1) return preds這個思路很直觀但坑也在這輸入用的預(yù)測值本身就是不準(zhǔn)的誤差會隨著步數(shù)增多不斷放大。我實(shí)測下來horizon6時還能看horizon24時后面基本變成一條平滑直線。緩解誤差累積有幾個實(shí)用技巧訓(xùn)練時用Teacher Forcing即以一定概率用真實(shí)值替代預(yù)測值去喂下一步讓模型適應(yīng)自己的預(yù)測對輸出做clip限制預(yù)測值的合理范圍避免極端值把窗口帶偏推理階段用確定性策略比如取中位數(shù)而不是單次路徑。3.6 評估與可視化評估指標(biāo)我用三個MAE、RMSE和R2。MAE好解釋RMSE對大誤差更敏感R2則能反應(yīng)模型對真實(shí)趨勢的擬合程度。from sklearn.metrics import mean_absolute_error, mean_squared_error, r2_score def evaluate_metrics(y_true, y_pred): mae mean_absolute_error(y_true, y_pred) rmse mean_squared_error(y_true, y_pred, squaredFalse) r2 r2_score(y_true, y_pred) return {MAE: mae, RMSE: rmse, R2: r2}畫圖建議用matplotlib把測試集真實(shí)值和預(yù)測值畫在同一張圖里。多步預(yù)測時我會把每個預(yù)測窗口的起點(diǎn)和終點(diǎn)連起來畫成階梯狀能更清楚地看到誤差累積發(fā)生在哪個階段。import matplotlib.pyplot as plt plt.figure(figsize(12, 5)) plt.plot(y_true, labelTrue) plt.plot(y_pred, labelPred) plt.legend() plt.title(Time Series Prediction) plt.show()這張圖是判斷模型有沒有“學(xué)到東西”的最快方式。如果pred和true的相位都對不上先檢查窗口長度是否合理如果趨勢對但局部抖動不對考慮加更多特征或調(diào)d_model。4. 常見問題與排查技巧實(shí)錄4.1 數(shù)據(jù)泄漏最隱蔽也最致命數(shù)據(jù)泄漏是時間序列預(yù)測里出現(xiàn)頻率最高的“幽靈問題”。除了歸一化泄漏還有一種是數(shù)據(jù)集劃分時不注意時間順序把未來樣本混進(jìn)訓(xùn)練集結(jié)果模型在測試集上表現(xiàn)“超神”一到線上就崩。處理辦法是嚴(yán)格按時間順序劃分且在構(gòu)造滑動窗口時讓訓(xùn)練集只使用該時間點(diǎn)之前的數(shù)據(jù)。另外如果數(shù)據(jù)來自多個實(shí)體比如多個城市或設(shè)備的序列不能把它們混在一起打亂劃分應(yīng)該按實(shí)體分組切分否則也會出現(xiàn)實(shí)體級別的泄漏。我自己的判斷標(biāo)準(zhǔn)很簡單如果訓(xùn)練集和測試集的MAE差距小得離譜或者測試集比訓(xùn)練集還好那大概率是泄漏了。正常情況訓(xùn)練誤差應(yīng)該略低于測試誤差這個經(jīng)驗(yàn)雖然不絕對但能幫你快速發(fā)現(xiàn)問題。4.2 訓(xùn)練Loss不降或變成NaN我遇到過一次Loss變成NaN的情況查了半天發(fā)現(xiàn)是沒有對輸入數(shù)據(jù)做歸一化數(shù)值稍微大一點(diǎn)經(jīng)過多頭注意力里的softmax后就爆炸了。解決方法是先把數(shù)據(jù)縮放到[0, 1]或標(biāo)準(zhǔn)化到均值0方差1再開始訓(xùn)練。如果標(biāo)準(zhǔn)化后還是NaN檢查一下學(xué)習(xí)率Transformer的訓(xùn)練不太吃固定的大學(xué)習(xí)率建議從1e-4或者3e-4開始試。還有一種可能是位置編碼的max_len不夠序列長度超過上限導(dǎo)致pe切片出問題這種一般會直接報IndexError不太會靜默NaN。另外一個容易忽視的點(diǎn)是batch_first。Pytorch的TransformerEncoderLayer默認(rèn)batch_firstFalse如果輸入維度是[batch, seq_len, feature]必須顯式設(shè)置batch_firstTrue否則會對seq_len維度做batch維處理雖然不報錯但結(jié)果完全不對。這種錯誤很難排查因?yàn)樗憩F(xiàn)成loss一直在下降但驗(yàn)證曲線不對勁。4.3 多步預(yù)測后期曲線“平”了多步預(yù)測的誤差累積問題前面提過這是所有遞歸式預(yù)測的通病。處理思路有兩個方向一是把模型換成直接多步輸出一次性預(yù)測完整未來區(qū)間從根源上避免遞歸累積二是引入機(jī)器學(xué)習(xí)里的魯棒性技巧比如訓(xùn)練時對輸入加小噪聲、預(yù)測時對輸出做平滑。我自己的經(jīng)驗(yàn)是如果horizon不超過10遞歸多步能省顯存且效果不差如果horizon到了24以上直接多步會更穩(wěn)定。建議在實(shí)驗(yàn)設(shè)置里同時保留這兩種模式用驗(yàn)證集決定到底用哪個。有時“曲線平了”也不全是誤差累積的問題可能是數(shù)據(jù)本身的信噪比太低。我畫過頻譜圖之后發(fā)現(xiàn)數(shù)據(jù)里真正可預(yù)測的成分只占很小一部分模型很容易傾向于輸出均值附近的值。這時候考慮對數(shù)據(jù)做差分或季節(jié)分解把趨勢和周期拆開建模再對殘差做預(yù)測。4.4 顯存和訓(xùn)練速度問題注意力矩陣的大小是平方級增長的窗口長度從24改成96顯存占用可能直接翻好幾倍。如果顯存不夠優(yōu)先調(diào)小batch_size或者用梯度累積gradient accumulation模擬更大的batch。Pytorch的自動混合精度AMP也值得開torch.cuda.amp里封裝得已經(jīng)很成熟能省不少顯存還能加速訓(xùn)練。下面是一個簡化的混合精度訓(xùn)練片段scaler torch.cuda.amp.GradScaler() for x, y in train_loader: optimizer.zero_grad() with torch.cuda.amp.autocast(): pred model(x) loss criterion(pred, y) scaler.scale(loss).backward() scaler.step(optimizer) scaler.update()AMP在NVIDIA GPU上用Pytorch 2.x已經(jīng)非常穩(wěn)定CPU上不用開。還有一個建議盡量用batch_firstTrue的TransformerEncoderLayerPytorch默認(rèn)是False如果搞錯了維度雖然報錯你會知道但排查起來很煩。4.5 長序列窗口的改進(jìn)空間標(biāo)準(zhǔn)Transformer處理幾百甚至上千的時間步時顯存和效率都會遇到瓶頸。我這次實(shí)驗(yàn)主要用的是中等長度窗口但如果你遇到超長序列建議看看Transformer的改進(jìn)變體比如Informer的稀疏注意力、Autoformer的分解機(jī)制、PatchTST把時間序列切成patch再編碼。這些都在標(biāo)準(zhǔn)Transformer的思路上做了針對性優(yōu)化很適合高頻金融數(shù)據(jù)、長時間傳感器監(jiān)測這類場景。我后續(xù)也在計劃把PatchTST并進(jìn)這套實(shí)驗(yàn)框架里做對比。另外提醒一句模型調(diào)參不是全部。數(shù)據(jù)質(zhì)量、特征工程、異常值處理對最終預(yù)測效果的影響往往比換模型更明顯。我在做這套實(shí)驗(yàn)時花了將近一半時間在清洗和構(gòu)建特征上模型本身雖然重要但絕不是唯一變量。做完整套單步、多步實(shí)驗(yàn)后我最深的體會是Transformer不是一個“萬能開關(guān)”它適合的是長依賴和多變量交互明顯的時間序列。在這套實(shí)驗(yàn)中我用Pytorch從數(shù)據(jù)預(yù)處理、模型搭建到評估可視化完整走了一遍也踩了不少坑。如果你正打算在自己的數(shù)據(jù)上復(fù)現(xiàn)建議先把數(shù)據(jù)好好看一眼再按文中的代碼結(jié)構(gòu)一點(diǎn)點(diǎn)搭別急著直接套大模型。先把單步跑通再多步最后再回頭調(diào)超參這樣每一步都能定位到問題。希望這篇記錄能幫你少走點(diǎn)彎路。本文還有配套的精品資源點(diǎn)擊獲取