ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

《预测模型》汇总

《预测模型》汇总 在数学建模中预测类问题是最常见的题型之一涉及经济、环境、交通、生物等多个领域。下面按模型类型进行系统汇总一、经典统计预测模型这类模型理论成熟可解释性强适合数据量不大、趋势明显、有统计规律的场景。算法核心思想适用场景优缺点线性回归 / 多元回归最小二乘法拟合自变量与因变量的线性关系趋势近似线性、影响因素明确的预测如销量与价格、气温与用电量简单、解释性强对非线性关系、异常值敏感岭回归 / Lasso回归在线性回归中加入 L2/L1 正则化防止过拟合自变量多重共线性严重或需要特征选择Lasso可压缩系数为0实现变量筛选逻辑回归用 sigmoid 函数将线性输出映射为概率二分类预测如是否违约、是否患病本质是分类但常出现在预测类问题中作为对比模型时间序列分解将序列分解为趋势、季节、随机成分有明显季节性和趋势的序列初步分析常作为预处理手段不是最终预测模型二、时间序列预测模型专为按时间顺序记录的数据设计是数学建模竞赛中的高频考点。1. 平滑法与经典模型移动平均 / 加权移动平均用窗口内均值预测适合无明显趋势和季节性的平稳序列。指数平滑法简单指数平滑适合无趋势无季节序列。Holt 线性趋势模型可捕捉线性趋势。Holt-Winters 模型同时处理趋势和季节加性/乘性。ARIMA 模型族差分自回归移动平均ARIMA(p,d,q)对非平稳序列通过 d 阶差分平稳后建模。SARIMA加入季节性差分和季节自回归/移动平均项处理复杂季节性。ARIMAX带外部变量的 ARIMA可引入节假日、促销等影响因素。2. 现代时间序列模型ProphetFacebook将序列分解为趋势、季节、节假日效应自动处理缺失值和异常值鲁棒性强适合业务预测。TBATS可处理多季节周期、非整数季节周期及 Box-Cox 变换无需手动调参。VAR / VECM向量自回归多变量时间序列相互影响时的预测如GDP与失业率联合预测。三、机器学习预测模型适合复杂非线性关系、特征维度高、数据量大的场景在数学建模中对提升预测精度作用显著。算法核心思想适用场景特点决策树回归以特征递归划分样本空间叶节点均值作为预测值可解释性要求高、特征交互复杂的非时序预测易过拟合通常作为基学习器随机森林回归多棵决策树的 Bagging 集成降低方差高维数据、缺失值较多、非线性问题抗噪声能力强能输出特征重要性GBDT 系列逐步拟合残差的 Boosting 集成梯度提升树结构化数据预测的首选竞赛常青树精度极高需注意调参防过拟合XGBoost / LightGBM / CatBoost对 GBDT 的工程优化支持并行、类别特征处理等表格数据预测的“最优”基准模型LightGBM 训练快CatBoost 对类别特征友好支持向量回归 (SVR)寻找一个 ε-不敏感管道最大化边界并最小化误差小样本、非线性、高维回归问题需谨慎选择核函数与参数对噪声容忍度有限K近邻回归 (KNN)预测值为最近 k 个邻居的均值/加权均值数据局部结构明显、特征空间欧氏距离有意义时对尺度敏感需归一化计算量大四、深度学习预测模型适合海量数据、序列依赖长、特征自动提取的复杂预测但在小数据集上容易过拟合需正则化或迁移学习。MLP多层感知机最简单的神经网络可用于回归预测拟合强非线性。RNN循环神经网络专门处理序列但存在长期依赖问题。LSTM / GRU通过门控机制解决长序列梯度消失是时间序列预测的深度学习基线。可多步输出、编码器-解码器结构、添加 Attention 机制。TCN时序卷积网络用膨胀卷积捕捉长距离依赖可并行计算有时优于 LSTM。Transformer基于自注意力机制可建模任意长度的依赖关系如 Informer、Autoformer 等变体被专门用于长时间序列预测。N-BEATS / DeepAR专门用于时间序列预测的深度架构DeepAR 还可输出概率分布。五、灰色预测模型适合小样本、信息贫乏、不确定性大的系统是中国数学建模特色方法之一。GM(1,1)对原始序列累加生成指数规律用微分方程建模后还原预测。需求数据少4个以上即可计算简单。GM(1,N)多变量灰色模型引入影响因子序列。改进形式新陈代谢 GM(1,1)、背景值优化、残差修正等。典型应用能源消费量、污染物浓度等具有饱和或近似指数趋势的短序列预测。六、组合预测模型将多个模型的预测结果进行融合通常能提升稳健性和精度。简单平均 / 加权平均根据各模型过去误差赋权。变权组合权重随数据动态变化可用方差倒数法、熵权法等确定。串联组合先用一个模型预测趋势再用另一个模型修正残差如 ARIMA 残差 GBDT 修正。模型融合框架Stacking用元学习器融合多基模型、Bagging、Boosting 等。七、其他特殊预测方法马尔可夫链预测基于状态转移概率矩阵预测离散状态变化如股市涨跌、天气状态。常与灰色模型结合使用。贝叶斯预测结合先验信息与样本数据得到后验预测分布能给出概率预测适合不确定性量化。模糊时间序列基于模糊集理论处理语言变量或模糊关系用于模糊环境预测。八、如何快速选择预测算法在实际建模中可按以下流程决策看数据特征时间序列 → 分析平稳性、季节性、趋势选用 ARIMA、Holt-Winters、Prophet 或 LSTM 等。截面数据/非时间 → 考察线性/非线性特征数量样本量。看样本量极少量10→ 灰色预测 GM(1,1) 或简单回归。少量几十~几百→ 经典回归、SVR、ARIMA。大量数千以上→ XGBoost、LightGBM、深度学习。看对可解释性的要求需要解释 → 回归、决策树、灰色模型、ARIMA。纯追求精度 → 集成学习、深度学习。看建模时间与计算资源快速出结果 → 平滑法、线性回归、Prophet。可以精细调参 → GBDT/LSTM/Transformer。建议组合策略在竞赛中经常采用“基线改进对比”的框架例如先建立 ARIMA 作为基准再用 LSTM 或 XGBoost 引入外部特征提升精度最后用组合预测进一步降低误差并展示误差分析、鲁棒性检验使论文充实有深度。
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进