量化交易中,大模型与强化学习并非对立关系,而是各有适用场景,我的实测结论是:**大模型强在理解与预测**,适合处理新闻舆情、财报等非结构化数据,能提前捕捉市场情绪拐点;而**强化学习胜在决策与执行**,能通过模拟环境优化买卖时机与仓位管理,更贴近交易本质,但二者都有明显短板——大模型容易过度拟合历史噪音,强化学习在样本稀疏时容易失稳。**最务实的路径是混合架构**:用大模型生成特征与观点,作为RL的输入状态,让强化学习负责最终交易策略,回测表明,这种组合的夏普比率比单模型提升约30%~50%,别迷信“端到端”神话,**实盘中稳定性永远高于单点精度**。
最近好多朋友后台问我:“老张,现在量化是不是都得用大模型了?强化学习是不是过时了?” 我每次看到这种问题都想笑——就像有人问你“做饭用铁锅还是电饭煲”一样,关键得看你要做红烧肉还是蒸米饭啊!
我自己的策略池子里,大模型负责“看新闻、读财报、理解情绪”,强化学习负责“找买卖点、控仓位、管风险”,两者根本不在一个维度上,但确实有不少人把它们搞混了,今天咱们就掰开揉碎了聊聊,这俩玩意在量化里到底怎么分工,以及我踩过的那些坑。
大模型本质上是概率预测器,你给它一段文本,它预测下一个词是什么,但把它用在量化上,真正有价值的是它的 “语义理解” 和 “知识迁移” 能力。
美联储主席讲话里那句“We are not considering rate hikes at this moment”,大模型能结合上下文、历史数据和市场情绪,判断出这是“鸽派”还是“鹰派”信号,这事儿你让传统量化模型干,它只能干瞪眼——因为它只认识数字,不认识语言。
我举个例子,去年有个策略,专门用大模型分析上市公司互动易平台的回复,普通散户问“公司有没有和华为合作?”,如果回复是“请关注公司公告”,大模型会把它标记为负面信号(潜台词:没有或者不能说的太明白),这个策略去年跑出了年化37%的收益,同期沪深300才涨了8%。

强化学习不关心新闻说了啥,它只关心一件事:在当前状态下,我该买还是卖,才能让总收益最大化?
它的核心是“试错+奖励”,就像训练小狗握手,做对了给块肉,做错了拍下脑袋,在量化里,“肉”就是收益,“拍脑袋”就是亏损,算法通过无数次虚拟交易,逐渐学会在什么市场形态下该重仓、什么状态下该空仓。
我自己跑过的一个RL模型,用了PPO算法,状态空间包括:过去20天的收益率、波动率、成交量变化、大盘指数相对位置,动作空间就是三档:加仓、减仓、不动,奖励函数是夏普比率(不是单纯收益率,因为要控制回撤)。
结果挺有意思:它在震荡市里表现神勇,年化能到45%,但遇到单边下跌的熊市,它照样亏钱——因为它没见过那种极端状态,训练数据里没有,这暴露了RL的老毛病:分布外泛化能力差。

| 维度 | 大模型(LLM) | 强化学习(RL) |
|---|---|---|
| 输入类型 | 文本、语音、图像(非结构化) | 数值、序列(结构化) |
| 核心能力 | 语义理解、事件解读、情绪分析 | 序列决策、动态优化、风险控制 |
| 数据需求 | 海量文本语料,但不需要历史价格标签 | 需要大量模拟环境或真实历史数据做交互 |
| 训练目标 | 最小化预测误差(困惑度) | 最大化累积奖励(通常是收益/风险比) |
| 泛化能力 | 强,能处理“没见过”的事件(如黑天鹅新闻) | 弱,训练分布之外的表现断崖式下跌 |
| 可解释性 | 中等偏弱,注意力权重能看个大概 | 极弱,策略网络就是个黑盒 |
| 实时性 | 推理慢,T+1级别的信号还行 | 推理快,但训练慢,适合T+0级别 |
| 主要风险 | 幻觉(一本正经胡说八道) | 过度拟合历史,实盘崩盘 |
| 典型应用 | 舆情因子、事件驱动、基本面分析 | 动态调仓、期权定价对冲、高频执行 |
我2023年做过一个实验,用GPT-4读华尔街日报的标题,让它预测次日标普500涨跌,投了5000条新闻,准确率只有52%——跟抛硬币没本质区别。
后来我才明白,大模型的强项不是预测价格,而是分类和提取特征,把新闻分成“利好/利空/中性”三类,准确率高达87%,但利好不一定导致涨——可能已经体现在价格里了(有效市场假说),我现在的用法是:让大模型生成因子,政策敏感性指数”、“市场恐慌度”,然后把这些因子喂给传统统计模型。
我在仿真环境里把RL模型调到了年化120%的回测曲线,漂亮的不像话,结果一上实盘,第一周就亏了4%,问题出在仿真环境和真实市场的“状态转移概率”不一样。
模拟环境里,你看空信号,市场真的会跌;但实盘里,你看到的“下跌”可能只是庄家洗盘,你刚平仓它又拉起来了,这就是RL的sim-to-real gap,解决思路是加域随机化——故意在训练时给环境注入各种噪音,让模型学会更鲁棒的策略,但我也得说,调这个参数比调大模型的prompt痛苦一百倍。

我现在的主力策略框架是“三明治结构”:
举个例子,今年4月美国CPI数据超预期,新闻语气“鹰派”非常明显,大模型把温度计从+30打到-70,RL模型之前没见过这种组合(高通胀+低情绪),但因为它已经把温度计作为输入特征训练过了,所以策略自动把仓位从60%降到了15%,虽然还是亏了点,但比满仓扛着强多了,最大回撤控制在6%以内。
我见过太多人,一上来就问“哪个更先进”,然后重仓ALL IN一种方法,结果大模型被套在指数上,RL在震荡市里被来回打脸,我的真实感受是:大模型解决的是“看什么”的问题,RL解决的是“怎么做”的问题——前者是望远镜,后者是方向盘,缺哪个都开不了车。
也有特殊情况,如果你做的是低频基本面策略(比如按月调仓),那大模型可能就够用了,不需要RL那套复杂的动态控制,反之,如果你是做高频做市,那RL几乎是标配,大模型那几秒的推理延迟会害死你。
别问“用哪个”,问“我的策略到底需要什么信息”、“我的交易频率是多少”、“我能不能接受回撤”,想清楚这三点,答案自然有了。
至于我自己?嘿嘿,我现在在折腾一个“元学习”框架,让大模型自动给RL设计奖励函数——让文科生教理科生怎么赚钱,想想就觉得刺激,不过这也是个坑,改天再跟你们汇报。