← 返回列表
Colossus (Invest Like the Best / Business Breakdowns)播客23 Jul 2019来源: traffic.libsyn.com主持: Patrick O'Shaughnessy

Eric Sorensen - How Quant Evolves - [Invest Like the Best, EP.139]

一句话导读

这篇访谈讲的是量化投资(用电脑模型选股)的进化史。管理460亿美元的Eric Sorensen认为,量化策略必须不断更新,不能死守老方法。他看好生物科技和制药行业,因为他们自己建了个模型,用马尔可夫链(一种概率计算工具)分析新药试验成功率,这个模型已经跑了10年。他还提醒,价值投资长期有效,但近几年信号有时会失灵。提到的重点标的:①生物科技/制药公司——他们用模型专门投资成功率高的公司;②商业银行——2008年金融危机时,他们用FDIC(美国存款保险公司)的贷款逾期数据,比同行表现好;③中国A股——他们用NLP(自然语言处理,让电脑读文字)分析中文聊天室情绪,但没赚到钱,只是学到了东西。

AI 摘要AI 生成 · 可能有误 · 以原文为准

Eric Sorensen(Panagora资产管理CEO,管理规模超460亿美元)在节目中探讨了量化投资策略的演变。核心观点包括:量化研究经历了从早期简单因子(如价值、动量)到复杂机器学习模型的演进;他提出“5C”框架(Character、Capacity、Collateral、Conditions、Covenants)用于风险溢价分析;当前风险溢价已大幅压缩,传统因子失效,需结合自然语言处理等新数据源。重要结论:量化策略需持续迭代,建立“研究墓地”记录失败信号;主动管理应融合专家系统与组合构建;年轻量化研究者需培养提出好问题的创造力。

全文约 13 分钟 · 12 个章节
深度解读

Eric Sorensen - 量化研究的进化之路

本期速览

Eric Sorensen(Panagora资产管理CEO,管理超460亿美元)拥有空军飞行员背景和40年量化研究经验。本期探讨量化策略从简单因子模型到机器学习、自然语言处理等前沿技术的演进,核心判断是:量化研究必须持续迭代,建立“研究墓地”记录失败信号,同时主动管理应融合专家系统与组合构建——Eric Sorensen认为“发现”与“美元”是驱动优秀量化机构的双重动力。


量化研究的四个历史阶段

Eric Sorensen将量化金融研究划分为四个演进阶段:

1. 资产定价均衡理论——CAPM模型(Treynor、Sharpe、Mossin、Lintner),描述“世界应该怎样”

2. 有效市场假说——Fama等人,描述“竞争使市场难以战胜”

3. 异常现象与行为金融——小盘股、盈利惊喜等实证发现,行为解释(人们错误时点买卖)

4. 资产定价计量经济学——Sorensen本人的研究领域:“能否更好地知道债券或股票应该在哪里交易?”

Sorensen指出,他的博士论文研究市政债券定价,使用多元回归模型,因变量为债券收益率/价格,自变量包括信用评级、市政信息、收益率曲线斜率、发行结构等。关键原则:模型必须有直观因果性——“即使使用高级工具,也不能只是价格与任何可能相关的东西之间的相关。”


风险溢价的“5C”生命周期框架

Eric Sorensen提出风险溢价策略的生命周期框架——“5C”:

阶段 描述
Character(特征) 创造性想法被发现,可能真正有效
Capacity(容量) 策略被复制,资金涌入
Collateral(抵押) 变得拥挤,可买资产供应有限
Conditions(条件) 外部催化剂(如美联储政策)使假设失效
Capitulation(投降) 流动性枯竭,最终崩溃

历史案例: 1987年股灾中的投资组合保险策略(Leland、Rubinstein、O'Brien的LOR策略)。该策略使用期货市场对冲股票,规模过大。1987年10月市场下跌时,投资组合保险程序触发,期货与现货市场连环下跌,最终道指单日暴跌22%。关键教训: 使用期权对冲(如BEA公司卖出虚值看跌期权)本可避免此灾难——自那天起,S&P平值看跌期权的隐含波动率始终存在偏斜,再未便宜过。

Sorensen认为价值投资是“真正的长期命题”——如果30-40年前开始做价值投资,让客户持有5年,会始终积累更多财富(随机占优)。但问题在于信号有时会失效(如近两年量化股票策略表现不佳),可能是拥挤或其他因素导致。


智能数据 vs. 大数据:专家系统的价值

Eric Sorensen强调“智能数据”优于“大数据”:

> “我把这称为智能数据和大贝塔。数据必须是智能的。大数据的供应商平均收入巨大,但很多没有明确定义的商业模式——他们恰好知道某些数据。”

关键原则: 智能数据必须满足三个条件:

1. 直观性——有道理(如卖方分析师正在做的事情)

2. 可收集性——能够优先获取(不从知名供应商购买)

3. 合理回报期——很少以“明天价格”作为因变量(非平稳性)

案例1:生物科技模型

团队构建了专家系统,模拟分析师对FDA审批流程的理解。使用马尔可夫链分析、概率模型评估药物试验成功率——生物科技公司成功率极低,模型买入“高于平均成功率”的公司。该模型已运行10年,现已成为独立生物科技/制药投资组合。

案例2:金融股模型(2007-2008年)

团队发现FDIC(联邦存款保险公司)收集了商业银行贷款组合的逾期率数据(1个月、2个月、3个月逾期百分比)。通过获取这些数据,可以对银行资产价值进行折价,从而更准确估值。Sorensen表示:“2007-2008年,我们的金融股表现比大多数好得多。” 但该数据现在已被商业化——供应商从FDIC购买后转售。

案例3:中国A股市场NLP

团队使用自然语言处理读取中文聊天室内容,识别情绪。由于中国存在审查制度,投资者使用俚语表达负面情绪(如“辣鸡”代替“垃圾”)。通过无监督机器学习识别这些表达模式。Sorensen坦言:“我不认为我们从中赚到了钱,但我们学到了很多。”


机器学习在投资中的适用边界

Eric Sorensen对AI/机器学习在金融市场的应用持谨慎态度:

> “无论国际象棋或自动驾驶有多少可能性,它们都是有限的、基于规则的、确定性的。金融市场中,这两点都不成立——你有布朗运动、随机过程,证券价格的结果几乎是无限的,而且不是基于规则的。”

适用领域:

  • 决策树/随机森林——自1987年起在Salomon Brothers使用分类树(非线性、分层、基于规则),现在使用多树、随机森林、时间序列结构(可学习并适应回报驱动因素的变化)。关键限制: 树必须修剪,不能完全填充(否则过拟合)。
  • 自然语言处理——读取公司文件(SEC的Edgar系统)。研究表明,CEO说话过多、重复是危险信号。Panagora在Edgar的点击量排名第二,但在查看内容的分散度上排名第一(包括脚注)。

Sorensen强调: “如果工程师或设计者不知道潜在的限制和陷阱,树必须被修剪——你不能让它们完全填充,否则会过拟合,得到虚假结果。”


研究墓地与失败信号

Eric Sorensen提出“研究墓地”概念——记录所有失败假设的地方。

失败案例:波动率预测

团队与诺贝尔奖得主Robert Engle合作,使用ARCH/GARCH模型预测波动率。Sorensen坦言:“我知道我们不会从中赚钱,但它非常吸引人。” 市场在应用波动率与统计预测波动率之间相当有效。

成功信号的识别标准:

  • 因子可能持续4-5年,半衰期约2年
  • 需要持续监控表现
  • 团队有“期望值模型”或“商业模型”来决定是否追求特定数据集
  • 关键问题:“它会增加3个基点还是4个基点?成本是多少?”

关于数据采购的决策框架:

> “如果供应商说这要花20万美元一年……你可以买这些数据,非常贵。或者你可以去街对面找一个洗窗户的人或做管道生意的人——那栋楼有40个租户,那个人有渠道知道租户是谁。贸易组织有这些信息。它是免费的。”


主动权益的双轨策略

Panagora的主动权益策略分为两种:

1. 动态权益(Dynamic Equity)

  • 不是“一刀切”的因子权重
  • 每只股票的因子权重不同(价值、动量、增长、质量等)
  • 通过将股票映射到4-5个风险分区(如成长股、小盘股、高贝塔股),从股票实际所在位置提取权重方案
  • Sorensen承认:“这仍然比一刀切好,但其他人已经复制了这一点。”

2. 深度行业模型

  • 如生物科技模型(基于药物试验概率)
  • 金融股模型(基于FDIC贷款逾期数据)
  • 每个行业/板块有独立的基本面驱动因素模型

模型更新频率: 因子可能持续4-5年,半衰期约2年。团队持续监控表现,并使用商业模型评估新数据集的边际价值。


非量化投资者的“安全港”

Eric Sorensen认为集中投资组合是非量化投资者的安全港:

> “集中投资组合。忘记阿尔法贝塔分离——那正在消失。你不能有一个所有人都必须跟踪的单一市值加权MSCI。那些真正能选股并拥有集中投资组合的人,我认为有他们的整个世界。”

关键条件:

  • 不能束缚他们(不能要求贝塔为1)
  • 客户应关注团队、流程、激情,而不仅仅是业绩记录
  • 允许持有现金

现代奥运会类比: 智能贝塔就像现代奥运会的专业化——不再是五项全能(一个运动员做所有事),而是短跑运动员、链球运动员、跨栏运动员等专业选手的集合。“你不会让165磅的短跑运动员去扔标枪,或让300磅的铅球运动员去短跑。”


对年轻量化研究者的建议

Eric Sorensen提出“三个圆圈”的维恩图框架:

圆圈 内容
领域知识 了解行业:交易员做什么?什么让价格每天变动?了解做市商、买方客户、粘性、周期
分析/算法 在学校学到的计算专长和算法
数据 了解数据质量——商业可用数据与大学能负担的数据不同

Sorensen指出: “我认识一个管理大型资管公司的人,他问我:‘你们有很好的量化分析师。我们去大学招聘有高级统计学学位的人。他们并不都成功。’——他们只得到了一个圆圈(技术),不了解行业,也不了解数据质量。”

建议: 理解所有三个圆圈都重要。“我的同事George Masali的故事是:他花了很多时间思考基本面分析师在做什么。他因此成为了一个好的量化分析师。”


提及的标的

标的 嘉宾态度 关键数据
生物科技/制药公司(行业) 看好(有独立模型) 模型运行10年,使用马尔可夫链分析药物试验成功率
商业银行(行业) 风险提示(但模型有效) 2007-2008年使用FDIC贷款逾期数据,表现优于同行
中国A股市场 中性(实验性) NLP读取50,000个中文字符,识别“辣鸡”等俚语情绪
投资组合保险策略(LOR) 风险提示(历史案例) 1987年股灾中策略崩溃,市场单日跌22%

值得记住的判断

1. Eric Sorensen: “量化研究有四个历史阶段——从CAPM到有效市场假说,到异常现象,再到资产定价计量经济学。我们目前处于第四阶段,但工具和数据已根本不同。”

2. Eric Sorensen: “风险溢价策略经历5C生命周期:特征→容量→抵押→条件→投降。1987年的投资组合保险是经典案例——策略变得太大,外部催化剂触发,最终流动性枯竭。”

3. Eric Sorensen: “智能数据优于大数据。它必须直观、可优先获取、有合理回报期。FDIC的贷款逾期数据是智能数据的典范——它免费、独特、有因果逻辑,但现在已被商业化。”

4. Eric Sorensen: “机器学习在金融市场有根本限制——证券价格的结果几乎是无限的,且不是基于规则的。但决策树/随机森林和NLP是有效应用,前提是工程师知道限制并修剪树以防止过拟合。”

5. Eric Sorensen: “因子可能持续4-5年,半衰期约2年。你需要持续监控,并使用商业模型评估新数据集的边际价值——‘它会增加3个基点还是4个基点?成本是多少?’”

6. Eric Sorensen: “非量化投资者的安全港是集中投资组合——忘记阿尔法贝塔分离。那些真正能选股并拥有集中投资组合的人有他们的整个世界,但你不能束缚他们(不能要求贝塔为1)。”

7. Eric Sorensen: “年轻量化研究者需要理解三个圆圈:领域知识、分析/算法、数据。只懂技术(一个圆圈)的人不会成功——花时间思考基本面分析师在做什么,才能成为好的量化分析师。”

8. Eric Sorensen: “研究墓地很重要——我们做了很多波动率预测工作(与诺贝尔奖得主Robert Engle合作),知道不会赚钱,但学到了很多。失败信号和成功信号同样有价值。”