在本文中,我们考虑了使用相同的预测精度测试程序在横截面依赖下实现了实现波动率测量的预测评估。在预测实现挥发性时,我们根据增强横截面评估模型的预测精度。在相等预测精度的零假设下,所采用的基准模型是标准的HAR模型,而在非相同的预测精度的替代方案下,预测模型是通过套索缩收估计的增强的HAR模型。我们通过结合测量误差校正以及横截面跳转分量测量来研究预报对模型规范的敏感性。使用数值实现评估模型的样本外预测评估。
translated by 谷歌翻译
本文介绍了用于在不同频率下采样的重尾依赖面板数据的结构化机器学习回归。我们专注于稀疏组的套索正规化。这种类型的正则化可以利用混合频率序列面板数据结构并提高估计的质量。我们获得了汇集和固定效果的Oracle不等式稀疏组套索面板数据估算器认识到财务和经济数据可能具有脂肪尾。为此,我们利用了由盗版$ \ Tai $ -Mixing流程组成的面板数据的新Fuk-Nagaev集中不等式。
translated by 谷歌翻译
预测组合在预测社区中蓬勃发展,近年来,已经成为预测研究和活动主流的一部分。现在,由单个(目标)系列产生的多个预测组合通过整合来自不同来源收集的信息,从而提高准确性,从而减轻了识别单个“最佳”预测的风险。组合方案已从没有估计的简单组合方法演变为涉及时间变化的权重,非线性组合,组件之间的相关性和交叉学习的复杂方法。它们包括结合点预测和结合概率预测。本文提供了有关预测组合的广泛文献的最新评论,并参考可用的开源软件实施。我们讨论了各种方法的潜在和局限性,并突出了这些思想如何随着时间的推移而发展。还调查了有关预测组合实用性的一些重要问题。最后,我们以当前的研究差距和未来研究的潜在见解得出结论。
translated by 谷歌翻译
我们使用深层部分最小二乘(DPL)来估算单个股票收益的资产定价模型,该模型以灵活而动态的方式利用调理信息,同时将超额回报归因于一小部分统计风险因素。新颖的贡献是解决非线性因子结构,从而推进经验资产定价中深度学习的当前范式,该定价在假设高斯资产回报和因素的假设下使用线性随机折现因子。通过使用预测的最小二乘正方形来共同投影公司特征和资产回报到潜在因素的子空间,并使用深度学习从因子负载到资产回报中学习非线性图。捕获这种非线性风险因素结构的结果是通过线性风险因素暴露和相互作用效应来表征资产回报中的异常情况。因此,深度学习捕获异常值的众所周知的能力,在潜在因素结构中的角色和高阶项在因素风险溢价上的作用。从经验方面来说,我们实施了DPLS因子模型,并表现出比Lasso和Plain Vanilla深度学习模型表现出卓越的性能。此外,由于DPL的更简约的架构,我们的网络培训时间大大减少了。具体而言,在1989年12月至2018年1月的一段时间内使用Russell 1000指数中的3290资产,我们评估了我们的DPLS因子模型,并生成比深度学习大约1.2倍的信息比率。 DPLS解释了变化和定价错误,并确定了最突出的潜在因素和公司特征。
translated by 谷歌翻译
了解特定待遇或政策与许多感兴趣领域有关的影响,从政治经济学,营销到医疗保健。在本文中,我们开发了一种非参数算法,用于在合成控制的背景下检测随着时间的流逝的治疗作用。该方法基于许多算法的反事实预测,而不必假设该算法正确捕获模型。我们介绍了一种推论程序来检测治疗效果,并表明测试程序对于固定,β混合过程渐近有效,而无需对所考虑的一组基础算法施加任何限制。我们讨论了平均治疗效果估计的一致性保证,并为提出的方法提供了遗憾的界限。算法类别可能包括随机森林,套索或任何其他机器学习估计器。数值研究和应用说明了该方法的优势。
translated by 谷歌翻译
我们通过随时间变化的因素负载开发了受惩罚的两次通用回归。第一遍中的惩罚对时间变化驱动因素强加了稀疏性,同时还通过正规化适当的系数组来维持与无契约限制的兼容性。第二次通过提供了风险溢价估计,以预测股权超额回报。我们的蒙特卡洛结果以及我们对大量横断面数据集的个人股票集的经验结果表明,如果不进行分组的惩罚可能会屈服于几乎所有估计的时变模型,违反了无标准限制。此外,我们的结果表明,与惩罚方法相比,所提出的方法在没有适当分组或时间不变的因子模型的情况下减少了预测错误。
translated by 谷歌翻译
Latent factor model estimation typically relies on either using domain knowledge to manually pick several observed covariates as factor proxies, or purely conducting multivariate analysis such as principal component analysis. However, the former approach may suffer from the bias while the latter can not incorporate additional information. We propose to bridge these two approaches while allowing the number of factor proxies to diverge, and hence make the latent factor model estimation robust, flexible, and statistically more accurate. As a bonus, the number of factors is also allowed to grow. At the heart of our method is a penalized reduced rank regression to combine information. To further deal with heavy-tailed data, a computationally attractive penalized robust reduced rank regression method is proposed. We establish faster rates of convergence compared with the benchmark. Extensive simulations and real examples are used to illustrate the advantages.
translated by 谷歌翻译
我们正式介绍了一个时序统计学习方法,称为自适应学习,能够在嘈杂的环境中处理模型选择,采样外预测和解释。通过仿真研究,我们证明该方法可以在条件切换的情况下呈现传统的模型选择技术,例如AIC和BIC,以及促进数据生成过程时的窗口尺寸确定是时变的。根据性地,我们使用该方法来预测S&P 500跨越多个预测视野,从VIX曲线和产量曲线采用信息。我们发现自适应学习模型通常与,如果不是更好的话,如果不是更好的参数模型,在MSE方面评估,同时也在交叉验证下表现优于效果。我们在2020年市场崩盘期间提出了学习结果的财务应用和对学习制度的解释。这些研究可以在统计方向和金融应用方面延伸。
translated by 谷歌翻译
本文提出了一种新的高维金融数据算法 - 该群体可解释基础选择(GIB)算法,以估计最近开发的广义套利定价理论暗示的新的自适应多因素(AMF)资产定价模型,它放松了风险因素的数量小的惯例。我们首先使用高维方法获得基础资产的自适应基础资产集合,然后同时测试该基础资产对应哪种证券。AMF模型以及GIBS算法显示出比FAMA-French 5因素模型具有明显更好的拟合和预测能力。
translated by 谷歌翻译
本文提出了删除 - $ D $ jackknife的概括,以解决时间序列的HyperParameter选择问题。我称之为人工删除 - $ D $ jackknife强调,这种方法用虚拟删除替代经典的去除步骤,其中观察到的数据点被人工缺失值替换。这样做保留了数据订单完好无损,并允许与时间序列的简单兼容性。此稿件显示了一种简单的例证,其中应用于调节高维弹性净矢量自动增加移动平均(Varma)模型。
translated by 谷歌翻译
最佳定价,即确定最大限度地提高给定产品的利润或收入的价格水平,是零售业的重要任务。要选择这样的数量,请先估计产品需求的价格弹性。由于混淆效果和价格内限性,回归方法通常无法恢复这些弹性。因此,通常需要随机实验。然而,例如,弹性可以是高度异构的,这取决于商店的位置。随着随机化经常发生在市级,标准差异差异方法也可能失败。可能的解决方案是基于根据从人工对照构成的治疗方法测量处理对单个(或仅几个)处理单元的影响的方法。例如,对于治疗组中的每个城市,可以从未处理的位置构成反事实。在本文中,我们应用了一种新的高维统计方法,以衡量价格变化对巴西主要零售商的日常销售的影响。所提出的方法结合了主成分(因子)和稀疏回归,导致一种称为因子调整的正规化方法的方法(\ TextTt {FarmTraTeat})。数据包括每日五种不同产品的日常销售和价格,超过400多名市。审议的产品属于\ emph {甜蜜和糖果}类别和实验已经在2016年和2017年进行。我们的结果证实了高度异质性的假设,从而产生了与独特的市政当局的不同定价策略。
translated by 谷歌翻译
We develop Bayesian neural networks (BNNs) that permit to model generic nonlinearities and time variation for (possibly large sets of) macroeconomic and financial variables. From a methodological point of view, we allow for a general specification of networks that can be applied to either dense or sparse datasets, and combines various activation functions, a possibly very large number of neurons, and stochastic volatility (SV) for the error term. From a computational point of view, we develop fast and efficient estimation algorithms for the general BNNs we introduce. From an empirical point of view, we show both with simulated data and with a set of common macro and financial applications that our BNNs can be of practical use, particularly so for observations in the tails of the cross-sectional or time series distributions of the target variables.
translated by 谷歌翻译
由于其出色的经验表现,随机森林是过去十年中使用的机器学习方法之一。然而,由于其黑框的性质,在许多大数据应用中很难解释随机森林的结果。量化各个特征在随机森林中的实用性可以大大增强其解释性。现有的研究表明,一些普遍使用的特征对随机森林的重要性措施遭受了偏见问题。此外,对于大多数现有方法,缺乏全面的规模和功率分析。在本文中,我们通过假设检验解决了问题,并提出了一个自由化特征 - 弥散性相关测试(事实)的框架,以评估具有偏见性属性的随机森林模型中给定特征的重要性,我们零假设涉及该特征是否与所有其他特征有条件地独立于响应。关于高维随机森林一致性的一些最新发展,对随机森林推断的这种努力得到了赋予的能力。在存在功能依赖性的情况下,我们的事实测试的香草版可能会遇到偏见问题。我们利用偏置校正的不平衡和调节技术。我们通过增强功率的功能转换将合奏的想法进一步纳入事实统计范围。在相当普遍的具有依赖特征的高维非参数模型设置下,我们正式确定事实可以提供理论上合理的随机森林具有P值,并通过非催化分析享受吸引人的力量。新建议的方法的理论结果和有限样本优势通过几个模拟示例和与Covid-19的经济预测应用进行了说明。
translated by 谷歌翻译
In a high dimensional linear predictive regression where the number of potential predictors can be larger than the sample size, we consider using LASSO, a popular L1-penalized regression method, to estimate the sparse coefficients when many unit root regressors are present. Consistency of LASSO relies on two building blocks: the deviation bound of the cross product of the regressors and the error term, and the restricted eigenvalue of the Gram matrix of the regressors. In our setting where unit root regressors are driven by temporal dependent non-Gaussian innovations, we establish original probabilistic bounds for these two building blocks. The bounds imply that the rates of convergence of LASSO are different from those in the familiar cross sectional case. In practical applications given a mixture of stationary and nonstationary predictors, asymptotic guarantee of LASSO is preserved if all predictors are scale-standardized. In an empirical example of forecasting the unemployment rate with many macroeconomic time series, strong performance is delivered by LASSO when the initial specification is guided by macroeconomic domain expertise.
translated by 谷歌翻译
我们考虑一个高维模型,其中观察到时间和空间的变量。该模型由包含时间滞后的时空回归和因变量的空间滞后组成。与古典空间自回归模型不同,我们不依赖于预定的空间交互矩阵,但从数据中推断所有空间交互。假设稀疏性,我们通过惩罚一组Yule-Walker方程来估计完全数据驱动的空间和时间依赖。这种正则化可以留下非结构化,但我们还提出了当观察结果源自空间网格(例如卫星图像)时定制的收缩程序。推导有限的样本误差界限,并且在渐近框架中建立估计一致性,其中样本大小和空间单元的数量共同偏离。外源性变量也可以包括在内。与竞争程序相比,仿真练习表现出强大的有限样本性能。作为一个实证应用,我们模型卫星测量了伦敦的No2浓度。我们的方法通过竞争力的基准提供预测,我们发现了强烈的空间互动的证据。
translated by 谷歌翻译
Using a comprehensive sample of 2,585 bankruptcies from 1990 to 2019, we benchmark the performance of various machine learning models in predicting financial distress of publicly traded U.S. firms. We find that gradient boosted trees outperform other models in one-year-ahead forecasts. Variable permutation tests show that excess stock returns, idiosyncratic risk, and relative size are the more important variables for predictions. Textual features derived from corporate filings do not improve performance materially. In a credit competition model that accounts for the asymmetric cost of default misclassification, the survival random forest is able to capture large dollar profits.
translated by 谷歌翻译
不同的代理需要进行预测。他们观察到相同的数据,但有不同的模型:他们预测使用不同的解释变量。我们研究哪个代理商认为它们具有最佳的预测能力 - 通过最小的主观后均匀平均平方预测误差来衡量 - 并且显示它如何取决于样本大小。使用小样品,我们呈现结果表明它是使用低维模型的代理。对于大型样品,通常是具有高维模型的代理,可能包括无关的变量,但从未排除相关的变量。我们将结果应用于拍卖生产资产拍卖中的获胜模型,以争辩于企业家和具有简单模型的投资者将在新部门过度代表,并了解解释横断面变异的“因素”的扩散资产定价文学中的预期股票回报。
translated by 谷歌翻译
使用可能的异质动力学估算时间序列数据的价值风险是一项高度挑战的任务。通常,我们面临着一个小的数据问题,结合了高度的非线性,因此对于经典和机器学习估计算法造成了困难。在本文中,我们提出了使用长期记忆(LSTM)神经网络的新型价值估计器,并将其性能与基准GARCH估计器进行比较。我们的结果表明,即使在相对较短的时间序列中,LSTM也可以用于完善或监视风险估计过程,并以非参数方式正确识别潜在的风险动态。我们对模拟和市场数据的估计器进行了评估,重点是异方差,发现LSTM在模拟数据上表现出与GARCH估算器相似的性能,而在实际市场数据上,它对增加波动性或降低波动性更为敏感,并且优于所有现有的现有估计器在异常率和平均分位数评分方面,价值风险。
translated by 谷歌翻译
在本文中,我们将深度学习文献与非线性因素模型联系起来,并表明深度学习估计可以大大改善非线性加性因子模型文献。我们通过扩展Schmidt-Hieber(2020)定理来提供预期风险的界限,并表明这些上限在一组多个响应变量上是均匀的。我们表明,我们的风险界限并不取决于因素的数量。为了构建资产回报的协方差矩阵估计器,我们开发了深层神经网络中误差协方差矩阵的新型数据依赖性估计器。估算器是指灵活的自适应阈值技术,对创新中的异常值很强。我们证明估计量在光谱规范中是一致的。然后使用该结果,我们显示了协方差矩阵的一致性和收敛速率和资产回报的精确矩阵估计器。两种结果中的收敛速度并不取决于因素的数量,因此我们的收敛性是因子模型文献中的一个新结果,因为这一事实是因素的数量妨碍了更好的估计和预测。除了精确矩阵结果外,即使资产数量大于时间跨度,我们也可以获得我们所有的结果,并且两个数量都在增长。各种蒙特卡洛模拟证实了我们的大型样本发现,并揭示了DNN-FM的卓越精确度,以估计连接因子和可观察变量的真实潜在功能形式,以及与竞争方法相比的协方差和精确矩阵。此外,在大多数情况下,就样本外投资组合策略而言,在样本外预测应用程序中,就样本外投资组合标准偏差和Sharpe比率而言,它的表现优于其他投资组合策略。
translated by 谷歌翻译
This paper extends quantile factor analysis to a probabilistic variant that incorporates regularization and computationally efficient variational approximations. By means of synthetic and real data experiments it is established that the proposed estimator can achieve, in many cases, better accuracy than a recently proposed loss-based estimator. We contribute to the literature on measuring uncertainty by extracting new indexes of low, medium and high economic policy uncertainty, using the probabilistic quantile factor methodology. Medium and high indexes have clear contractionary effects, while the low index is benign for the economy, showing that not all manifestations of uncertainty are the same.
translated by 谷歌翻译