← 返回列表
Colossus (Invest Like the Best / Business Breakdowns)播客12 Jun 2018来源: traffic.libsyn.com主持: Patrick O'Shaughnessy

Michael Recce – Tim Cook’s Dashboard - [Invest Like the Best, EP.91]

一句话导读

这篇讲的是用机器学习和替代数据来重建企业业务仪表盘,从而获得投资信息优势。作者认为机器学习对预测股价没用,但对预测企业业务增长非常有效。他重点提了三个标的:Blue Apron(IPO时表面数据好看,但拆解客户群组后发现新客户粘性下降、获客成本上升,提示风险);Lululemon(通过推断消费者性别,观察到男性客户占比持续上升,被看好);Walmart(9%客户贡献50%营收,客户集中度上升,提示风险)。

AI 摘要AI 生成 · 可能有误 · 以原文为准

Neuberger Berman首席数据科学家Michael Recce探讨如何利用数据和机器学习在投资中创造信息优势。核心观点是:如果给全球最优秀的苹果分析师配备Tim Cook的私人业务仪表盘,其价值将不可估量。Recce的目标是为多家企业重建类似的公司仪表盘,帮助分析师比市场更准确地判断企业基本健康状况和方向。他承认机器学习对预测股价无效,但在数据提取和分类等任务上极为有用。关键在于从噪声中提取真实信号,并建立可持续的数据优势。

全文约 10 分钟 · 9 个章节
深度解读

Michael Recce – Tim Cook's Dashboard - [Invest Like the Best, EP.91]

本期速览

Michael Recce是Neuberger Berman首席数据科学家,此前曾任Point72和GIC(新加坡主权财富基金)首席数据科学家,并创立过反洗钱分析和在线广告定向公司。本期主线:如何利用机器学习和替代数据重建企业级仪表盘,创造信息优势。全片最有分量的判断:机器学习对预测股价「毫无用处」(useless),但对预测企业业务增长这种「相对平稳」的问题极为有效——因为股价是非平稳的,而业务增长是平稳的。


主题一:数据不是信息——关键在于「重建企业仪表盘」

Recce认为,如果给全球最优秀的苹果分析师配备Tim Cook的私人业务仪表盘,其价值不可估量。 他的核心目标正是为多家企业重建类似仪表盘——不是简单汇总数据,而是深入到产品线、地理区域、客户群组(cohort)的颗粒度。

  • 机制拆解:Recce将企业数据视为「数字残渣」(digital residue)——来自廉价电子设备的交易级信息。例如信用卡交易记录、网页浏览行为、手机定位等。关键在于,这些数据不是直接拿来用,而是需要经过「信息提取」过程。
  • 数据≠信息:Recce强调,数据本身已经商品化(「每个人都能买到信用卡数据」),但信息是另一回事。「人们一直在找沙滩表面的闪亮鹅卵石,却没有真正用数据来构建模型。」真正的优势在于如何加工数据——例如通过推断消费者的人口统计特征(性别、年龄、收入水平),来观察Lululemon对男性客户的吸引力是否在上升。
  • 具体案例Blue Apron IPO时,表面看客户数和营收都在上升。但按客户加入的群组(cohort)拆解后,发现每个新群组的客户粘性越来越低、获客成本越来越高——业务基本面完全不同。「一个层次的细节差异,就让业务看起来完全变了样。」

Recce将这一过程类比为「为股票市场建Zillow」——Zillow自动估值房产,虽不如最顶尖的估价师精准,但胜在自动化和规模化。同理,先用数据自动构建企业估值模型,再与市场价格对比。


主题二:机器学习有用与无用的边界——「预测股价是灾难,预测业务增长是利器」

Recce明确划出边界:机器学习对预测股价「毫无用处」(useless),但对预测企业业务增长「非常有用」。 核心原因在于平稳性(stationarity)问题。

  • 非平稳 vs 平稳:「股价波动由各种情绪和制度驱动,是非平稳的;但企业某个业务板块的增长像一块岩石,非常稳固、非常平稳。」Recce用类比说明:YouTube上识别猫之所以可行,是因为「猫」这个类别相对稳定;预测股价之所以不可行,是因为输入变量到输出变量的映射本身就不存在。
  • 历史脉络:Recce在互联网广告领域(Quantcast)的经验是关键铺垫——「如果我知道该给你看什么广告,我就知道你对什么产品感兴趣;如果我知道所有地理区域和所有产品的情况,我就知道今天谁在市场上赢。」这套逻辑直接迁移到投资:交易级数据揭示的是企业真实健康状况,而非市场情绪。
  • 证伪条件:如果机器学习模型试图预测股价短期走势,Recce认为「这个问题本身就是误导性的——假设存在从输入到输出的映射,这已经错了。」

主题三:预测「失败」比预测「成功」更容易——不对称的预测空间

Recce提出一个反直觉判断:预测一家公司何时会失败,比预测它何时会大获成功要容易得多。 这一洞察来自他帮助构建大学入学论文评分系统的经历。

  • 机制拆解:在论文评分中,对「差论文」的判断高度一致——错误类型有共识;但对「好论文」的判断因人而异——「激励一个人的东西,不一定激励另一个人。」企业同理:失败的空间(市场份额流失、客户基础恶化、财务问题)相对有限且模式可识别;而成功的空间(创新、市场扩张、新商业模式)则极其广阔且难以预测。
  • 数据支撑:Recce引用研究显示,标普500成分股的平均留存时间从40-50年下降到约12年,且仍在下降。「数万亿美元每年流入被动投资,但你买入的标的越来越不可能成为长期赢家。」如果能用数据识别出「输家」,就可以构建一个指数型组合——超配赢家、低配输家,每年多赚50-100个基点,而运行成本仅10个基点。
  • 推演:这可能导致资金从被动管理回流到主动管理——「AI驱动的主动管理过程,波动率低,基本跟随指数但略跑赢,因为它擅长发现负面的东西。」

主题四:数据科学的可持续优势——深度加工与多源交叉验证

Recce认为,数据科学领域的护城河不在于数据本身(已商品化),而在于「从数据到信息的加工深度」和「多数据源的交叉验证能力」。

  • 加工深度:大多数使用者只是将数据汇总成营收数字(「如果你只是汇总成营收,那何必需要颗粒数据?」)。真正的优势在于构建企业模型——例如观察帕累托分布(80-20法则)的变化:沃尔玛9%的客户贡献50%营收,如果这个比例变成8%,意味着分布更陡峭、客户集中度更高——这是不健康的信号;而亚马逊的分布则在变扁平,客户基础在扩大,这是更健康的信号。
  • 多源交叉验证:「数字残渣」天然带有噪声和错误,需要多个数据源相互印证。除了营收端,还可以看成本端——招聘信息(OPEX领先指标)、原材料价格(鸡肉价格对KFC的影响)、背景调查数据等。
  • 技术栈优势:Recce强调,互联网公司的技术栈远领先于传统金融机构。「在传统机构,技术团队的第一任务是让火车准点运行,第二是安全,遥远的第三才是跟上技术;在互联网公司,跟不上技术你就死了。」例如,谷歌一位AI研究员用一夜时间从Google街景中提取了法国所有门牌号——这在传统IT架构下几乎不可能。

主题五:数据科学家的组织方式——「勘探者」优于「采矿者」

Recce用「采矿者 vs 勘探者」的类比来描述数据科学团队的组织哲学。 他认为,在一个全新的领域,让聪明人各自探索(勘探者模式)优于自上而下的集中指令(采矿者模式)。

  • 机制拆解:采矿者模式——全公司围绕一个目标(如Intel的下一代处理器)协同工作,效率高但风险集中(「所有鸡蛋在一个篮子里」)。勘探者模式——每个科学家有自己的实验室,不需要互相沟通,只要有人发现金矿,整个公司就赢了。
  • 实践方法:短周期敏捷迭代——「想法永远多于资源,让团队自组织选择最佳想法,短时间验证,证明有效就继续,无效就换。」Recce认为这种模式不仅更有效,而且创造更好的工作环境。
  • 与投资流程的结合:Recce建议,传统基金经理应该与数据科学家建立「桥梁」——「你说你喜欢一家公司因为管理层优秀,那优秀长什么样?是更好的成本效率?新产品?新地理扩张?不同类型的招聘?如果你告诉我它长什么样,我就能去找数据验证。」

提及的标的

标的 嘉宾态度 关键数据
Blue Apron 风险提示 IPO时客户数和营收表面上升,但按群组拆解后,新客户粘性下降、获客成本上升
Lululemon 看好(案例) 通过推断消费者性别,观察到男性客户占比在持续上升
Walmart 风险提示(案例) 9%的客户贡献50%营收,帕累托分布正在变陡峭(客户集中度上升)
Amazon 看好(案例) 帕累托分布在变扁平,客户基础在扩大,是更健康的信号
Starbucks 中性(案例) 可通过数据测量忠诚度计划的转化率及转化后的消费变化
Home Depot 中性(案例) 月度数据好时,分析师倾向于回归均值,而非线性外推
Whole Foods 中性(案例) 亚马逊收购后降价,触发「蜜月期」效应,相当于所有门店重新开业

值得记住的判断

1. 「机器学习对预测股价毫无用处,但对预测业务增长极为有用。」(Recce)——股价是非平稳的,受情绪和制度驱动;业务增长是平稳的,像岩石一样稳固。这是机器学习应用的根本边界。

2. 「预测一家公司何时失败,比预测它何时大获成功要容易得多。」(Recce)——失败的空间有限且模式可识别(市场份额流失、客户恶化);成功的空间无限且因人而异。这使「识别输家」成为更可行的策略。

3. 「数据已经商品化,但信息不是。」(Recce)——每个人都能买到信用卡数据,但如何从中提取信息(如推断消费者人口统计特征、观察客户群组变化)才是真正的护城河。

4. 「如果你只是把颗粒数据汇总成营收数字,那何必需要颗粒数据?」(Recce)——大多数使用者只做表面汇总,真正的价值在于重建企业仪表盘:按产品、地理、客户群组、时间线拆解。

5. 「帕累托分布的变化方向,比营收数字更能揭示企业健康度。」(Recce)——沃尔玛的分布变陡峭(客户集中度上升)是不健康信号;亚马逊的分布变扁平(客户基础扩大)是健康信号。

6. 「勘探者模式优于采矿者模式——在新领域,让聪明人各自探索比集中指令更有效。」(Recce)——短周期敏捷迭代,自组织选择最佳想法,快速验证。

7. 「如果你说喜欢一家公司因为管理层优秀,那优秀长什么样?告诉我,我就能去找数据验证。」(Recce)——这是连接基本面分析与数据科学的关键桥梁。

8. 「未来已经来了,只是分布不均匀。」(Recce引用William Gibson)——数据科学在华尔街仍处于早期阶段,10年内将彻底改变行业格局,卖方可能比买方更先被颠覆。