ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

PyMC 贝叶斯分位数回归:3 步让安全库存不再只靠均值

PyMC 贝叶斯分位数回归:3 步让安全库存不再只靠均值 PyMC 贝叶斯分位数回归3 步让安全库存不再只靠均值【免费下载链接】pymcBayesian Modeling and Probabilistic Programming in Python项目地址: https://gitcode.com/GitHub_Trending/py/pymc备多少货才不缺货均值预测永远答不准它只给出“平均卖多少”而你要的是“最坏卖多少”。PyMC 的贝叶斯分位数回归把 90%、95% 分位数直接当成回归目标用 MCMC 后验把“卖爆”风险算成一条可解释的曲线。分位数回归到底在解决什么问题金融风控真正危险的是尾部损失95% 分位数才是预警线平均损失只是参考。供应链按平均需求备货大促日必然缺货90% 分位数才配得上“安全库存”四个字。用户留存平均使用时长分不清大 R 和路人分位数能把用户切进不同运营策略的档位。直觉上分位数就是“按位置取数”。班级平均分 70但按排名看75 分位可能是 82 分——均值压平了分布分位数保留了结构。分位数回归做的事就是把“每个 x 对应一条平均线”换成“每个 x 对应一组指定位置的分位线”。PyMC 里的贝叶斯做法先验、似然、后验三步走每步一句话先验把业务经验写成参数范围比如斜率不会超过 ±5。似然描述数据如何从参数中生成这里选不对称拉普拉斯分布。后验MCMC 采样出所有参数的联合分布不确定性量化是副产品。PyMC 把分布、采样器和 ArviZ 诊断组织在同一条流水线里似然选不对称拉普拉斯分布AsymmetricLaplace它把误差按分位数加权$$f(y\mid\mu,\sigma,q)\propto\exp\left(-\frac{|y-\mu|}{\sigma}\left[q,\mathbb{1}(y\ge\mu)(1-q),\mathbb{1}(y\mu)\right]\right)$$q0.9 时“预测偏低”的代价是“预测偏高”的 9 倍μ 自然被推到 90% 分位。建模写法很小import numpy as np import pandas as pd import pymc as pm import arviz as az x_data np.linspace(0, 10, 100) y 1 1.2 * x_data np.random.normal(0, 1, 100) with pm.Model() as model: beta pm.Normal(beta, mu0, sigma5) # 宽先验先让数据说话 sigma pm.HalfNormal(sigma, sigma2) # q 决定位置参数最终收敛到哪个分位数 pm.AsymmetricLaplace(y_obs, mu1.0 beta * x_data, bsigma, q0.9, observedy)从数据到诊断PyMC 分位数回归实操流程先造一批异方差模拟数据方差随 x 变大正是均值回归吃亏的场景np.random.seed(42) n 300 x np.linspace(0, 10, n) y 2 1.2 * x np.random.normal(0, 0.8 * (x / 10 0.5), n)同一份数据上建 90% 分位数模型并采样with pm.Model() as model: beta pm.Normal(beta, mu0, sigma5) sigma pm.HalfNormal(sigma, sigma2) mu 1.0 beta * x pm.AsymmetricLaplace(y_obs, mumu, bsigma, q0.9, observedy) idata pm.sample(2000, cores2, tune1000)诊断只盯两件事R-hat 是否收敛、后验预测区间覆盖率是否接近名义分位print(idata.sample_stats.r_hat) # 全部 1.01 才算收敛 az.plot_forest(idata) # 森林图可信区间 r_hat 一览 ppc pm.sample_posterior_predictive(idata) lo, hi np.percentile(ppc.posterior_predictive.y_obs, [5, 95], axis(0, 1)) print(float(np.mean((y lo) (y hi)))) # ≈0.9 说明模型可信森林图里94% 可信区间窄、r_hat 贴近 1说明截距和斜率都估稳了多分位数联合建模与贝叶斯不确定性量化分开跑三次得到的是三组互不相干的参数无法互相比较也无法保证 10% 线始终在 90% 线下方。联合建模让三条分位线共享同一批数据后验里天然带着分位间的相关结构。qs [0.1, 0.5, 0.9] with pm.Model() as model: beta pm.Normal(beta, mu0, sigma5, shapelen(qs)) sigma pm.HalfNormal(sigma, sigma2, shapelen(qs)) for i, q in enumerate(qs): pm.AsymmetricLaplace(fy_q{int(q*100)}, mu1.0 beta[i] * x, bsigma[i], qq, observedy) idata pm.sample(2000, cores2) post idata.posterior[beta].mean((chain, draw))把post[0]和post[2]画出来就是 10% 与 90% 分位数曲线。图上看点50% 线贴近均值回归线10% 与 90% 线的间距随 x 拉大说明条件分布的离散度在增长间距本身就是“此处预测更不可靠”的可视化。 两个可以照搬的落地模板场景 A客户 LTV 的 90% 分位数预测重点在宽先验与显式提取分位数df pd.read_csv(customer_ltv.csv) # 字段recency, frequency, ltv X df[[recency, frequency]].values with pm.Model() as ltv_model: alpha pm.Normal(alpha, mu0, sigma10) beta pm.Normal(beta, mu0, sigma10, shape2) sigma pm.HalfNormal(sigma, sigma10) pm.AsymmetricLaplace(ltv, mualpha X beta, bsigma, q0.9, observeddf[ltv].values) idata_ltv pm.sample(1500) p90 idata_ltv.posterior[ltv] # 逐客户的 90% LTV 后验直接分群上线前最需要检查拿历史数据回测90% 预测值高于真实 LTV 的客户比例是否约等于 90%。场景 B零售需求的 95% 上界用于补货点分层结构给每个门店一个截距df pd.read_csv(demand.csv) # 字段store, day, demand store_idx pd.factorize(df[store])[0] with pm.Model() as inv_model: store_mu pm.Normal(store_mu, mu50, sigma20, shapedf[store].nunique()) beta pm.Normal(beta, mu0, sigma5) sigma pm.HalfNormal(sigma, sigma10) pm.AsymmetricLaplace(demand, mustore_mu[store_idx] beta * df[day], bsigma, q0.95, observeddf[demand].values) idata_inv pm.sample(1500) p95 idata_inv.posterior[demand].mean((chain, draw)) # 直接进补货点公式上线前最需要检查95% 区间对历史真实需求的覆盖率以及门店截距有没有被先验过度收缩。⚠️ 常见坑与下一步先验过宽Normal(sigma100) 会让后验又平又钝MCMC 走得慢、R-hat 容易破 1.01业务上能约束的一律写紧先验。分位数交叉各分位数斜率独立时大 x 处 10% 线可能越过 90% 线用共享结构或对斜率加单调约束。异方差未处理方差随 x 变化时单一 sigma 必然顾此失彼先让 sigma 成为协变量的函数再谈拟合好坏。q 太贴边q0.999 的似然极度偏斜自相关飙升先用 0.99 验证再谈极端分位。进阶方向非线性分位数回归把 beta·x 换成样条基展开PyMC 里只是多一个点积时序分位数给分位函数加高斯过程先验捕捉分位数随时间的漂移。API 速查AsymmetricLaplace参数含义mu位置参数即目标分位函数 Q_q(y|x)b尺度参数0作用类似标准差q目标分位数0q1与 kappa 二选一kappaq 的另一种参数化kappa√(q/(1-q))延伸阅读PyMC 官方文档、概率分布指南、连续分布单元测试。【免费下载链接】pymcBayesian Modeling and Probabilistic Programming in Python项目地址: https://gitcode.com/GitHub_Trending/py/pymc创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进