Skip to main content

第11章:另类数据

11.1 另类数据的本质

在本书中,到目前为止讨论的因子主要是基于传统交易和基本面数据构建的。然而,随着越来越多的投资者开始接触和应用这些概念,并且随着资本开始在许多发达股票市场中交易这些因子,它们的回报逐渐减少,导致曾经的阿尔法转变为贝塔。为了获取更多信息,更准确、及时地捕捉市场动态,从而从其他来源获得回报,行业实践者已越来越多地将注意力转向另类数据的研究和使用。

另类数据指的是非传统的信息来源,包括但不限于社交媒体数据、众包数据、金融交易数据、文本数据、图像数据、卫星数据、环境指标和地理位置数据。通过利用这些数据,量化研究人员可以尝试分析这些数据背后的概念如何影响股票回报,从而构建预测性因子。然而,充分利用另类数据需要研究人员具备更高水平的技能。从数据收集到了解数据生成过程,到数据处理,再到整合数据逻辑以形成因子逻辑,需要克服许多挑战。此外,有些数据难以获取且购买成本高昂。因此,虽然另类数据在因子构建方面前景广阔,但也带来了重大挑战。

本章的目标是探索另类数据在因子投资中的潜在用途。具体来说,第11.2节介绍另类数据的常见来源。以技术联系和股票回报为例,第11.3节详细演示了如何使用另类数据构建因子以获得超额回报。此外,我们将介绍关于这一主题的两项研究,以启动关于数据及其利用方法的迭代升级的讨论。第11.4节重点关注使用机器学习算法处理另类数据。第11.5节讨论使用另类数据相关的风险与挑战。最后,第11.6节总结本章。

11.2 另类数据的潜在来源

如第11.1节所述,存在多种多样的另类数据类型。本节对每一种进行简要讨论,作为读者的参考。

11.2.1 社交媒体数据

社交媒体数据指的是用户在社交媒体平台上生成的信息,为投资者和分析师提供了丰富的资源,以揭示消费者行为、市场趋势和潜在投资机会的见解。Xu和Zhang(2013)认为,维基百科通过调节管理者对坏消息的自愿披露并减少投资者对此类消息的负面反应,改善了金融市场的信息环境,突显了通过使用社交媒体平台聚合信息的价值。通过对社交媒体活动和情绪进行复杂分析,可以从Twitter、Facebook、Reddit、Wikipedia和LinkedIn等平台上提取有价值的见解,用户在这些平台上自由分享他们对广泛话题的意见和情绪。

例如,投资者密切关注Twitter上关于特定股票或公司的讨论和情绪,分析推文的量、语气和内容,以衡量市场情绪并识别潜在交易机会(Liew and Budavari 2017)。此外,可以采用情绪分析技术来评估社交媒体对话的整体情绪极性,提供市场情绪的定量度量,作为传统金融指标的补充。

在股市应用方面,Antweiler和Frank(2004)对发布在Yahoo Finance和Raging Bull上的超过150万条消息进行了全面研究,这些消息涉及道琼斯工业平均指数和道琼斯互联网指数上市的45家公司。他们的研究表明,股票消息有助于预测市场波动性,并包含关于回报的重要预测信息。在另一项研究中,Chen等人(2014)调查了通过社交媒体传播的投资者意见能在多大程度上预测意外的公司盈利和未来股票回报。通过对美国最受欢迎的投资者社交媒体平台上的文章及其评论进行文本分析,作者发现两者都能预测回报和意外盈利。

11.2.2 众包数据

众包数据是从大量人群中收集的信息,通常是志愿者或普通公众的贡献者,他们提供数据、想法或反馈。一个值得注意的众包数据来源是Glassdoor等平台,员工在这些平台上匿名评论公司并分享他们的经验。这些评论提供了对公司文化、管理实践、工作场所满意度和员工情绪的独特见解。表明员工高满意度和强大企业文化的正面评论可能暗示着有利的投资机会,而负面评论则可能预示着公司可能面临的风险或挑战。

Green等人(2019)探讨了Glassdoor.com上的员工评论与股票回报之间的关系。直观地说,评分较高的公司应该表现更好,从而提供更高的预期股票回报。为了检验这一假设,他们根据员工评论的变化将股票分为三组,并通过做多高分组和做空低分组构建了一个多空投资组合。实证结果支持了他们的假设,显示该投资组合具有显著的平均超额回报。

此外,Da、Huang和Jin(2021)使用散户投资者在Forcerank App上的每周股票评级来研究投资者的过度外推信念与未来股票回报之间的负相关关系。然而,由于数据限制,他们的样本仅限于2016年2月至2017年12月,涉及不到300只股票和大约1000名用户。因此,他们的发现在多大程度上可以推广到整个市场仍然存疑。

11.2.3 金融交易数据

金融交易数据提供了丰富的信息,可以为投资者和分析师提供宝贵的见解。这些数据可能包括在线销售、支付历史、信用使用率以及其他表明信用度的因素等详细信息。Yi、Zhang和Zhao(2023)的研究强调了在线销售增长在预测公司未来股票回报和盈利惊喜方面的重要性。

金融交易数据相比传统的财务报告有几个优势。首先,它通常比季度财务报告更早可用,提供对业务表现的实时洞察。例如,企业对消费者(B2C)平台上的电子商务交易提供了对零售产品价格和数量的即时访问。其次,交易数据可能揭示在汇总财务报告中未披露的信息,提供对业务运营的更全面理解。最后,金融交易数据相比可能受到操纵或管理层自由裁量权影响的财务报告往往更加客观。利用金融交易数据,投资者可以及时、客观地洞察市场趋势和潜在投资机会,增强他们在量化投资策略中的决策过程。

11.2.4 文本数据

文本数据包括在文档、报告、社交媒体帖子、新闻文章等中发现的任何非结构化文本。它不仅包括使用的词语,还包括上下文、情感以及语言随时间的变化。文本数据分析涉及从这些文本中提取有意义的信息,这可以深入洞察公司的行为、策略和潜在未来表现,使其成为学术和金融研究的宝贵资源(Gentzkow, Kelly, and Taddy 2019, Loughran and McDonald 2020)。

近年来,许多研究分析了上市公司财务报告中的文本信息以研究股票回报,其中最具代表性的工作之一是Cohen、Malloy和Nguyen(2020)的研究。该研究考察了美国上市公司季度和年度报告中的文本变化是否与股票回报相关。正如其标题“懒惰的价格”所揭示的,该研究发现,报告中文本修改较少的公司往往具有更高的预期未来回报。一种做多文本变化较小的公司、做空文本变化较大的公司的投资策略产生了超过20%的年化超额回报。

这篇文章的精妙之处在于它对潜在机制的讨论。Cohen、Malloy和Nguyen(2020)确定了财务报告中文本修改背后的几个原因:更负面的情绪、更高的不确定性、诉讼风险的增加以及CEO/CFO的变更。这些因素通常意味着公司面临更高的运营风险和不确定性。此外,该研究深入探讨了财务报告中哪些部分在文本变化方面最为关键,包括第1A项:风险因素。

类似地,Lopez-Lira(2020)也分析了财务报告中的风险因素部分。使用潜在狄利克雷分配(LDA),该研究从风险因素部分提取了25个风险主题。进一步分析显示,其中一些代表了不同公司面临的系统性风险,其中部分系统性风险被定价。基于这些风险的因子模型的定价能力与传统的Fama-French三因子或五因子模型相当。

与前述研究要么从文本数据构建因子要么探索异象的方法不同,Bybee、Kelly和Su(2023)基于文本数据分析开发了一个实证资产定价模型,借鉴了Bybee等人(即将出版)的研究。后者开发了一个创新模型,利用LDA将1984年至2017年间《华尔街日报》的文章组织成180个不同的主题,如小盘股、大宗商品和抵押贷款,然后计算每个主题的时间序列注意力得分。

Bybee、Kelly和Su(2023)的基本前提是假设财经新闻揭示了投资者对未来投资机会的信念,从而影响资产价格。为了探索这一假设,该研究利用资产收益与主题注意力数据之间的协方差作为工具变量,构建了一个潜在因子模型。该模型的实证发现为资产定价提供了新的见解,表明财经新闻中特定主题的注意力分配确实可以作为资产价格的重要决定因素。

11.2.5 图像数据

图像数据指的是广泛的视觉内容,包括照片、图表和图形。这种数据类型特别富含通过传统数值或文本分析不易捕捉的信息。图像数据可以更直观和直接的方式传达复杂信息,如环境变化、消费者行为、公司活动和市场情绪。图像数据的分析,特别是随着卷积神经网络等高级机器学习技术的出现,为提取与股票回报相关的预测信息开辟了新途径。

Obaid和Pukthuanthong(2022)对新闻照片中的情绪进行分类,并创建了一个每日投资者情绪指数。研究发现,该情绪指数能有效预测市场回报和交易量。然而,需要指出的是,该研究探讨了照片中的悲观情绪与新闻文本中的悲观情绪在股票价格预测方面的可替代性,发现两者之间存在替代而非互补的倾向。

在另一项研究中,Jiang、Kelly和Xiu(2023)将CNN应用于股票K线图。这可以被视为Lo、Mamaysky和Wang(2000)早期工作的重大进展。与基于预定义规则计算动量或反转因子的传统方法不同,他们的方法识别出与未来回报高度相关的复杂价格模式。这些模式与传统的技术分析趋势(如第5章所述)显著不同,并包含更多的预测信息。

11.2.6 卫星数据

卫星数据为寻求洞察各种经济指标和趋势的投资者和分析师提供了独特而宝贵的资源。例如,卫星图像可以有效用于跟踪作物产量、航运活动和零售客流量等因素,提供能够指示更广泛经济状况的有价值信息。

卫星数据在投资中的一个显著应用来自瑞士投资银行瑞银,它与Remote Sensing Metrics LLC等卫星公司合作,分析沃尔玛商店的停车场占用率。通过利用特定时间段内进出沃尔玛停车场的汽车的卫星图像,瑞银可以估算顾客客流量并推算出季度销售数据。与传统的季度财务报告等数据收集方法相比,这种方法在时效性方面具有显著优势,因为传统方法常常存在延迟,并可能受到操纵或粉饰效应的影响。

此外,卫星图像在危机时期(如COVID-19大流行期间)已被证明是重要的工具,它被用于跟踪美国以外的石油库存,为全球宏观经济活动提供关键见解。展望未来,将卫星图像数据整合到基于AI的系统中,有望增强投资决策中的预测分析。随着投资者和对冲基金对及时、准确数据的需求持续增长,获取高质量卫星图像的竞争预计将加剧,推动该领域的进一步创新和进步。

11.2.7 环境数据

环境数据包括关于气候、天气模式、污染水平和自然灾害等各种环境因素的信息,这些因素可能显著影响经济活动和投资决策。在量化投资策略中利用环境数据提供了一个将非传统信息源纳入决策过程的独特机会。

例如,气候数据分析可以提供关于天气条件对农业产量、能源消耗模式和基础设施脆弱性潜在影响的见解。通过利用卫星图像和遥感技术,投资者可以监测土地利用变化、森林砍伐率和城市化趋势,为在受影响地区经营的公司的可持续性和韧性提供宝贵的见解。此外,环境数据在评估公司的环境、社会和治理(ESG)表现方面可以发挥重要作用,帮助投资者识别可持续投资机会并管理与气候变化和环境法规相关的风险。

总体而言,将环境数据整合到量化投资模型中,使投资者能够更深入地理解环境因素与金融市场之间的相互作用,促进更明智的投资决策,并有助于长期价值创造。

11.2.8 地理位置数据

地理位置数据涉及与个人、资产或事件的地理位置相关的信息,为空间趋势、移动模式和区域动态提供了宝贵的见解。在量化投资策略中,利用地理位置数据可以提供独特的机遇,以更深入地理解消费者行为、经济活动和市场趋势。

例如,通过分析移动设备数据和GPS信号,投资者可以跟踪客流模式、识别热门零售地点,并评估实体店的表现。这些信息对于零售商、房地产投资者以及在运输和酒店行业运营的公司尤其有用。此外,地理位置数据在分析供应链物流、优化配送路线以及评估交通基础设施项目对地方经济的影响方面可以发挥重要作用。此外,地理位置数据可以提供关于城市化趋势、人口流动和人口结构变化的宝贵见解,帮助投资者识别新兴市场和潜在投资机会。通过将地理位置数据整合到量化模型中,投资者可以增强对空间动态的理解,并根据空间趋势和模式做出更明智的投资决策。

总之,另类数据的潜在来源可能远远超出我们目前的理解。从抽象的角度来看,我们可以分析核心投资观点:投资者在特定情况下将资本配置到某些资产中。在此框架内,出现了三个主要元素:主体——包括关于投资者属性及其对不同股票情绪的信息;客体——包括股票数据,如公司表现和行业趋势;以及状语——代表投资发生的条件,如微观市场环境和宏观经济状况。重要的是,对另类数据的使用没有严格的限制,为想象力和探索新可能性提供了充足的空间。

11.3 示例:技术联系与股票回报

在本节中,我们以公司间的技术联系为例,说明如何利用另类数据获取超额回报。关于这一主题的两项关键学术研究是Lee等人(2019)以及Bekkerman、Fich和Khimich(2023)的工作。这些工作不仅强调了通过技术进步利用信息的日益复杂性,而且反思了另类数据结合先进算法对市场效率的影响。值得注意的是,这些研究也是第2章“量化基本面”中讨论的主题的典型代表,该章侧重于从经济关联公司衍生的因子。

11.3.1 技术联系(I)

在知识经济时代,技术实力已成为公司短期盈利能力和长期生存能力的关键因素。亚马逊、谷歌和苹果等科技巨头可能提供截然不同的产品,但它们共享着错综复杂的技术联系,这些联系往往超越了传统的行业边界,并且不易从财务报告中识别。Lee等人(2019)研究了公司间技术联系与未来股票回报之间的关系。其基本前提是,技术进步的溢出效应可能影响一系列具有高技术联系的公司,改变它们的基本面,并最终反映在它们的股价中。

基于这一前提,Lee等人(2019)揭示了焦点公司i在t+1时刻的股票回报与其所有技术关联公司j在t时刻的回报之间存在滞后-领先关系。通过采用度量技术联系的代理指标,并将其作为这些关联公司回报的权重,我们可以推导出加权回报,并将其用作焦点公司i的因子。这个加权回报对焦点公司下一期的回报具有预测能力,使其成为一个可行的因子。这种领先-滞后关系也被称为技术动量。

从上述描述中可以清楚地看出,计算公司之间的技术联系对于构建这一因子至关重要,这正是Lee等人(2019)与Bekkerman、Fich和Khimich(2023)的不同之处。具体来说,Lee等人(2019)应用了两家公司专利分布之间的无中心相关性,这也是Jaffe(1986)以及Bloom、Schankerman和van Reenen(2013)采用的方法: [ TECH_{i,j,t} = \frac{ T_{i,t}' T_{j,t} }{ \left( T_{i,t}' T_{i,t} \right)^{1/2} \left( T_{j,t}' T_{j,t} \right)^{1/2} } \quad (11.1) ] 其中 ( TECH_{i,j,t} ) 代表公司 (i) 和 (j) 在时期 (t) 的技术联系,( T_{i,t} ) 是一个具有427维的行向量,即 ( T_{i,t} = (T_{i,t,1}, T_{i,t,2}, \ldots, T_{i,t,427}) )。这个数字来源于美国专利商标局定义的427个技术类别。因此,在他们的工作中,公司的专利分布由其在过去五年中在这427个类别中获得的全部技术专利的比例来定义。例如,假设一家公司在第1、第100和第303个类别中分别拥有10、60和30项专利,那么该公司专利分布中的相应元素满足 ( T_{i,t,1}=0.1, T_{i,t,100}=0.6, T_{i,t,303}=0.3 ),而所有其他类别的 ( T_{i,t,k} ) 值为0。

图11.1展示了Regeneron Pharmaceuticals和Illumina在2002年至2006年间在技术专利类别上的分布。Regeneron是一家制药公司,而Illumina生产生命科学工具并提供基因分析服务。尽管这些公司经营的行业不同,没有明显的供应链联系,但技术联系为它们之间的联系提供了一个新的视角——两家公司在第435类(分子和微生物学)中都有大量专利,导致 ( TECH_{i,j,t} ) 为0.71。因此,技术联系揭示了被行业分类和供应链所忽略的公司之间的关系。实证证据表明,这些联系在选股方面具有相当大的潜力,为寻求利用这种相互联系获取超额回报的投资者提供了肥沃的土壤。

在推导出 ( TECH_{i,j,t} ) 之后,因子的计算很简单: [ TECHRET_{i,t} = \frac{ \sum_{j \neq i} TECH_{i,j,t} \cdot r_{j,t} }{ \sum_{j \neq i} TECH_{i,j,t} } \quad (11.2) ] 其中 ( r_{j,t} ) 是关联公司 (j) 在时间 (t) 的回报。实证上,使用1963年至2012年的数据,Lee等人(2019)发现,通过做多 ( TECHRET ) 最高十分位组并做空最低十分位组构建的多空投资组合实现了显著的超额回报。例如,在等权和市值加权下,该投资组合的平均月度超额回报分别为1.17%(t统计量5.47)和0.69%(t统计量3.19)。此外,即使在考虑了其他常见因子之后,这些超额回报的稳健性仍然存在。除了投资组合排序分析,Fama-MacBeth回归也揭示了类似的结果。

深入探讨技术联系的内在机制,该研究发现多空投资组合在随后的几个月持续产生超额回报。这表明技术动量代表了一个价格发现过程,在此过程中,随着投资者逐渐吸收关于具有技术联系的公司的信息,股票价格会进行调整。可以推断,市场对技术基本面相关新闻的吸收是一个缓慢的过程,可能导致错误定价。作者通过考虑技术创新信息的性质、投资者对此类创新的关注程度,以及投资者试图对错误定价进行套利时所面临的成本来验证这一假设。这一推理路线得到了探索创新新闻传播特征及其对股票价格影响的文献的支持(例如,参见Cohen and Frazzini 2008)。

11.3.2 技术联系(II)

在完善技术联系度量方面,Bekkerman、Fich和Khimich(2023)利用先进的机器学习算法增强方法论,迈出了渐进的一步。与依赖专利分类的Lee等人(2019)的研究不同,Bekkerman、Fich和Khimich(2023)直接深入专利文本,提取技术术语并计算其重叠度来衡量公司之间的相似性。这种方法可以被视为技术联系的进化度量。

在他们的实证分析中,作者首先为技术关联公司之间存在经济联系建立了证据,这一点至关重要。基于T-links构建的因子的有效性取决于经济联系的存在;否则,它很可能只是一个幻影。在他们的研究中,他们从盈利能力和技术创新的角度考察了焦点公司与其技术关联公司之间的关系。对于盈利能力,他们检查了焦点公司和关联公司之间资产收益率(ROA)的同期和预测关系。对于技术创新,他们使用研发支出相对于总资产的比率进行了类似的分析。研究结果表明,盈利能力指标和创新指标均具有显著的同期和预测正相关关系。这些实证结果强调了技术相似公司之间的经济联系,为资产定价提供了基础。

此外,Bekkerman、Fich和Khimich(2023)将他们的新因子与Lee等人(2019)构建的因子进行了比较,发现新因子优于旧因子。这一点很明显,因为在控制了Lee等人(2019)的 ( TECHRET ) 因子后,基于专利文本数据的新因子仍然能产生超额回报。然而,反过来则不成立,即一旦考虑了新因子,Lee等人(2019)的 ( TECHRET ) 因子就无法产生超额回报。此外,实证证据表明,2000年之后,Lee等人(2019)的 ( TECHRET ) 因子在产生超额回报方面效果减弱,而新因子保持了其显著性。

Bekkerman、Fich和Khimich(2023)不仅提供了一个精细化的T-links度量,而且还展示了经济联系在不断演变的市场格局中的持久相关性,从而为文献做出了贡献。它强化了这样一种观念:对专利进行深入的文本分析可以揭示公司之间更深层次的经济联系,这对于构建稳健的投资策略至关重要。这些进展反映了技术创新与金融市场之间的动态相互作用,为学者和实践者提供了细致的见解。

11.3.3 对市场效率的影响

我们以讨论另类数据和先进机器学习算法对市场效率的影响来结束本节,新T-link因子优于旧因子的现象就是例证。这并非T-link因子独有的现象,而是一种随着数据丰富度和构建方法的发展而可能出现在各种因子中的模式,导致升级后的因子在实证检验中不可避免地优于其前身。

新T-link因子在2000年后有效,而基于专利分类的旧因子效果减弱,这可以从两个角度来解释。第一个角度涉及投资者注意力有限导致信息传播缓慢的问题——这在前文讨论过。第二个角度借鉴了Nagel(2021)以及Martin和Nagel(2022)的见解,关注投资者学习如何影响市场效率。如今,变量构建变得更容易,但几十年前,即使数据可能已经可用,投资者对这些变量的访问和使用也有限。专利文本就是一个例子;基于文本计算相似度比使用专利分类更复杂,这意味着投资者获取和处理专利数据的成本更高,从而使其更难使用。这种数据可获取性的稀缺可以看作迫使投资者在定价资产时依赖过于稀疏的估值模型。Martin和Nagel(2022)的分析表明,用当代方法和先进模型构建的因子,在对历史数据进行测试时,可以在样本内和样本外预测股票回报。然而,随着另类数据和技术变得更加普及,一旦投资者将这些另类数据纳入他们的估值模型,它们的预测能力可能会减弱。

毫无疑问,另类数据开启了因子投资的新篇章。然而,当我们使用通过新数据和新技术发现的协变量时,必须深入思考它们能够产生超额收益的根本原因。虽然另类数据和机器学习为投资策略提供了新的见解和机会,但它们也突显了市场效率的演变性质。

另类数据影响市场效率的一个关键方式是提供对驱动资产价格的基础因素更全面、更及时的视图。传统的金融数据源(如公司财务报表和经济指标)在覆盖范围和频率上存在局限性。另一方面,另类数据可以提供实时或近实时的信息,使投资者在理解市场动态和做出明智的投资决策方面具有优势。通过纳入更广泛的数据点,市场参与者可以更深入地洞察消费者行为、供应链动态、产品需求以及影响资产估值的其他因素。

此外,另类数据可以揭示仅从传统数据源可能不明显的隐藏模式和关系。通过利用机器学习和人工智能等高级分析技术,市场参与者可以识别预测信号并生成创造阿尔法的投资策略。这些洞察可以导致更准确的资产定价,减少错误定价,提高市场效率。

然而,需要注意的是,另类数据的采用和利用也带来了挑战。数据质量、隐私问题以及需要强大的数据治理框架是关键的考虑因素。此外,将另类数据解释并整合到投资过程中需要复杂的分析能力和专业知识。市场参与者需要发展必要的技能和基础设施,以有效利用另类数据的力量,同时确保其负责任和合乎道德的使用。

11.4 利用机器学习处理另类数据

在另类数据处理领域,与机器学习方法的整合发挥着重要作用。非结构化数据的复杂性和多样性(通常以非整齐格式化数字的形式出现,如文本、图像或其他格式)对传统数据处理技术提出了挑战。然而,随着深度学习技术的发展,我们现在能够使用强大的机器学习算法从这些数据中提取有价值的见解。

例如,在文本数据处理中,循环神经网络和Transformer等深度学习模型已被证明非常有效。这些模型可以捕捉文本中的语义和情感细微差别,实现情感分析和主题建模等任务。类似地,用于图像数据的CNN和Transformer模型在提取关键信息(如对象识别和场景理解)方面表现出了卓越的能力。因此,机器学习算法的应用为我们提供了强大的工具,可以从非结构化的另类数据中发掘更深层次的见解和价值。

在获得一组另类数据后,最初的探究通常从其描述性变量和收集方法开始,思考这些数据是否可能影响股票回报预测。虽然可以形成初步假设,但严格检验它们并非易事。此外,如果最初的猜想失败,并不一定意味着这些数据无用。因此,我们可以考虑直接利用算法,特别是复杂的深度学习算法,来训练模型并测试这些数据是否能提高模型的预测精度。需要明确的是,这个过程并不等同于将训练好的模型直接部署到交易中。实际交易需要对数据背后的逻辑进行更深入的研究和理解。尽管如此,这种方法是一种评估信息价值的快速验证方法。当使用另类数据训练模型时,典型目标是验证数据的预测能力。如果另类数据显著提高了模型的预测精度,则可能表明该数据确实包含关于资产回报的增量信息。

另一种应用机器学习模型的方法涉及将交易数据与机器学习模型相结合,以稳定从另类数据中收集的信息。由于来自不同另类数据源的信息最终通过投资者交易行为反映在股票价格中,我们可以尝试使用交易数据来重构另类数据的生成过程。这个过程也使我们能够衡量另类数据是否真正提供了附加价值。如果某份另类数据可以被完全拟合,并且其样本外表现与拟合数据的趋势一致,那么它的附加价值可能是有限的。

总体而言,机器学习在另类数据的利用方面展现出巨大的潜力,随着算法的发展,将揭示更多的信息。随着机器学习算法的不断发展和进步,我们可以更深入地研究和利用另类数据中包含的信息。随着深度学习技术的成熟和应用的扩大,我们可以更有效地处理文本、图像等非结构化数据,提取越来越有价值的见解。此外,随着机器学习算法在处理大规模数据和复杂模型方面的改进,我们可以更准确地建模和预测股市趋势。因此,即使我们尚未完全解锁另类数据的潜力,只要我们相信它们对股票回报具有预测能力,我们就可以通过稳定的长期供应或收集方法来保存这些数据。随着机器学习算法的进步,这些数据可能成为未来获取阿尔法的关键要素之一。

11.5 另类数据的风险与挑战

虽然另类数据为探索资产定价和量化投资中的新因子提供了多种可能性,但其使用也伴随着一系列风险和挑战。

11.5.1 风险

一个潜在的风险涉及数据的质量和真实性。另类数据的准确性和可靠性可能存在很大差异。例如,数据可能不完整、报告不准确或受到操纵,导致基于有缺陷前提的错误结论和策略。

此外,另类数据的供应可能不稳定,容易受到中断或变化的影响。用户必须为此类突发事件做好准备,特别是在量化投资系统中,通过实施措施来减轻这些风险。这包括在数据更新不及时或数据分布发生变化时及时调整模型,以防止对系统其他方面产生不利影响。有时,甚至可能需要将每套另类数据作为单独的子投资组合进行管理,以防范供应中断。

此外,另类数据可能涉及敏感的商业信息或隐私问题,构成潜在的监管风险。在较小程度上,这可能导致数据供应中断;在极端情况下,可能导致因隐私泄露或内幕交易而受到法律审查。因此,谨慎且合规地使用另类数据对于确保其来源和应用的合法性至关重要。

另类数据和机器学习技术的使用也可能将决策转移到自动化系统,从而削弱人类判断的作用。投资者和资产管理者必须保持对投资策略和算法的监督和问责,并对其结果负责。

11.5.2 挑战

新数据类型是一把双刃剑。一方面,由于它们的新颖性,其使用尚未拥挤;另一方面,如果没有必要的领域知识,用户可能难以发挥其全部潜力。

在许多人的想象中,另类数据可能是激动人心的叙事,已经被供应商处理成结构化格式,可以直接用于因子构建。然而,现实往往类似于发现一座未知的山脉:其潜在的财富和切入点在探索之前是未知的。在行业中,大型资产管理公司通常由于其充足的人才储备而在内部分析数据。或者,数据供应商通常以充满希望的情景来营销其产品。除了买方和卖方,市场上还出现了代表投资者进行另类数据分析的第三方研究机构。

使用来自供应商或第三方的处理后的数据对投资者来说无疑很方便。然而,这种做法有其缺点:由于广泛的营销和相关报告的流传,处理后的例子可能广为人知,导致交易信号拥挤。因此,深入挖掘原始数据以发现独特见解至关重要。因此,掌握领域知识——包括理解另类数据是如何生成的、它们背后的业务流程以及它们的财务含义——至关重要。这种掌握确保了对研究的控制,并提高了发现独特阿尔法来源的可能性。

一个伴随的挑战是数据源的细微演变可能被忽视。因此,在应用另类数据时,有必要对数据分布进行更严格的监控,以检测异常并持续验证研究逻辑。如果预测性能发生显著变化,就需要深入探究数据和逻辑,以确定是否存在任何问题,并考虑停止使用。

此外,另类数据的分布可能存在偏差,需要仔细构建框架以防止分析结果不具有代表性。以之前提到的Green等人(2019)为例,Glassdoor数据存在潜在问题,例如雇主激励员工发表五星评价。此外,人们对雇主不满时更倾向于发表负面评论,这引发了关于数据是否无偏的担忧。投资者和资产管理者必须对此类偏差保持警惕,并采取措施降低其风险。

此外,另类数据的历史跨度较短,可能难以得出确定性的研究结论。为了解决这个问题,可以首先采用逻辑驱动的研究方法以减少数据驱动的偏差,然后随着时间的推移逐渐建立对逻辑的信任,之后再将其应用于实践。

11.6 结论

近年来,另类数据在因子投资中的应用显著增加。实践者热衷于将更广泛的信息纳入其投资策略,以获得竞争优势。然而,另类数据的使用带来了许多挑战和风险,包括与数据质量相关的问题、应对数据中断、潜在的监管审查以及道德问题。

尽管存在这些障碍,未来另类数据在因子投资中的应用可能会持续增加。这一趋势是由投资者在日益拥挤和竞争激烈的投资环境中获得竞争优势和实现超额回报的愿望驱动的。此外,交易信号相关性的降低可能会降低市场中系统性风险的概率。

使用交易和金融数据构建的因子通常更容易分析其有效性。然而,另类数据可能较少受交易活动的影响,具有更强的持久性,这是一种权衡。随着市场成熟并变得更加有效,从传统数据衍生的因子的有效性可能会减弱,从而引发对另类数据的兴趣增加。因此,另类数据在量化投资行业的使用程度可以作为市场成熟度的指标。

此外,另类数据在因子投资中的应用不应仅限于因子发现的目标。考虑范围应扩展到理解另类数据如何能够阐明资产收益随时间以及横截面的驱动因素、另类数据对各种金融参与者行为的影响、数据丰富度与资产价格信息含量之间的动态关系,以及另类数据如何影响投资者学习及其导致虚假可预测性的潜力。这些问题可能比单纯的因子发现更为关键。

例如,Dessaint、Foucault和Fresard(2022)探讨了另类数据的丰富度是否提高了财务预测的质量。他们发现,另类数据的出现降低了获取短期预测数据的成本,同时提高了其准确性。因此,另类数据促使分析师投入更多精力获取和分析短期预测信息,从而提高了短期预测的准确性。然而,鉴于分析师的注意力有限,这种转变无意中降低了他们长期预测的准确性。

虽然另类数据的实际应用和处理确实具有挑战性,但其不可否认的潜力不容忽视。即使遭遇失败,对另类数据的探索仍然是一项极其引人入胜的工作。深入研究另类数据不仅积累知识和经验,还能加深我们对市场动态的理解。因此,接触另类数据不仅仅是为了追求新的投资因子,也是为了丰富我们对金融市场及其潜在机制的理解。


参考文献

Antweiler, W. and M. Z. Frank (2004). 所有的谈论都只是噪音吗?互联网股票留言板的信息内容. Journal of Finance 59(3), 1259–1294.

Bekkerman, R., E. M. Fich, and N. V. Khimich (2023). 创新相似性对资产价格的影响:来自专利大数据的证据. Review of Asset Pricing Studies 13(1), 99–145.

Bloom, N., M. Schankerman, and J. van Reenen (2013). 识别技术溢出与产品市场竞争. Econometrica 81(4), 1347–1393.

Bybee, L., B. T. Kelly, A. Manela, and D. Xiu (即将出版). 商业新闻与经济周期. Journal of Finance.

Bybee, L., B. T. Kelly, and Y. Su (2023). 叙事资产定价:来自新闻文本的可解释系统性风险因子. Review of Financial Studies 36(12), 4759–4787.

Chen, H., P. De, Y. Hu, and B.-H. Hwang (2014). 众智:通过社交媒体传递的股票观点的价值. Review of Financial Studies 27(5), 1367–1403.

Cohen, L. and A. Frazzini (2008). 经济联系与可预测回报. Journal of Finance 63(4), 1977–2011.

Cohen, L., C. Malloy, and Q. Nguyen (2020). 懒惰的价格. Journal of Finance 75(3), 1371–1415.

Da, Z., X. Huang, and L. Jin (2021). 横截面中的外推信念:我们能从大众那里学到什么? Journal of Financial Economics 140(1), 175–196.

Dessaint, O., T. Foucault, and L. Fresard (2022). 另类数据能改善财务预测吗?水平效应. 工作论文.

Gentzkow, M., B. T. Kelly, and M. Taddy (2019). 作为数据的文本. Journal of Economic Literature 57(3), 535–574.

Green, T. C., R. Huang, Q. Wen, and D. Zhou (2019). 众包雇主评论与股票回报. Journal of Financial Economics 134(1), 236–251.

Jaffe, A. B. (1986). 技术机会与研发的溢出效应:来自公司专利、利润和市场价值的证据. American Economic Review 76(5), 984–1001.

Jiang, J., B. Kelly, and D. Xiu (2023). (重新)想象价格趋势. Journal of Finance 78(6), 3193–3249.

Lee, C. M. C., S. T. Sun, R. Wang, and R. Zhang (2019). 技术联系与可预测回报. Journal of Financial Economics 132(3), 76–96.

Liew, J. and T. Budavari (2017). “六”因子——直接从推文情绪导出的社交媒体因子. Journal of Portfolio Management 43(3), 102–111.

Lo, A. W., H. Mamaysky, and J. Wang (2000). 技术分析的基础:计算算法、统计推断与实证实现. Journal of Finance 55(4), 1705–1765.

Lopez-Lira, A. (2020). 重要的风险因子:回报横截面中风险披露的文本分析. 工作论文.

Loughran, T. and B. McDonald (2020). 金融中的文本分析. Annual Review of Financial Economics 12, 357–375.

Martin, I. W. R. and S. Nagel (2022). 大数据时代的市场效率. Journal of Financial Economics 145(1), 154–177.

Nagel, S. (2021). 资产定价中的机器学习. Princeton University Press.

Obaid, K. and K. Pukthuanthong (2022). 一图胜千言:结合机器学习和新闻照片衡量投资者情绪. Journal of Financial Economics 144(1), 273–297.

Xu, S. X. and X. M. Zhang (2013). 维基百科对市场信息环境的影响:关于管理层披露和投资者反应的证据. MIS Quarterly 37(4), 1043–1068.

Yi, Y., B. Zhang, and X. Zhao (2023). 基于真实交易在线销售数据的会计质量度量. 工作论文.