「AQuA:会自我改进的量化研究智能体,crypto 因子 IC 0.19、美股策略夏普 2.5」

# 「AQuA:会自我改进的量化研究智能体,crypto 因子 IC 0.19、美股策略夏普 2.5」 > 量...

「AQuA:会自我改进的量化研究智能体,crypto 因子 IC 0.19、美股策略夏普 2.5」

> 量化投研正在从”大模型单次调用”跃迁到”多智能体自主协作 + 递归自改进”,而 AQuA 把”用证据指导下一轮提案”写进了框架内核。

一、AQuA 是什么:两个互不共享的密封沙箱

arXiv:2608.12841(8/14)提出的 AQuA,是一个用于量化投研的递归自改进框架。它由两套相互独立的 LLM 驱动系统组成:一套做符号因子发现,一套做可训练模型开发。关键点在于——它们不共享 agent、记忆、候选空间,也不共享研究状态,各自待在”密封沙箱”里,只用已被验证的证据去指导下一轮提案。这种隔离避免了单一模型的逻辑偏置在迭代中被放大。

flowchart TB subgraph F[因子系统-密封沙箱] F1[生成候选因子] –> F2[验证纠错] F2 –> F3[评估 IC/rankIC] F3 –> F4[入库去相关] F4 –>|证据反馈| F1 end subgraph M[模型系统-密封沙箱] M1[生成模型提案] –> M2[回测验证] M2 –> M3[夏普评估] M3 –> M4[策略入库] M4 –>|证据反馈| M1 end F -.不共享状态.-> M

二、成绩单:可解释、可回测的阿尔法

因子系统:在 crypto 宇宙上组合信息系数 IC ≈ 0.190。 – 模型系统:美股单股 IC 达 +0.0843,转化为阈值多空策略后,留出样本夏普最高 +2.50(双边成本),且 2021–2025 每年为正

与之呼应,另一篇 arXiv:2608.11785 的 TradingMoE 用稀疏 MoE + Query-Key 路由器把 token 专业度匹配到市况,并机制化更新非活跃专家,在股、crypto 上相对 22 个基线累计收益提升 超 30%。两条线共同指向:LLM 不再只是”写因子代码的工具”,而是能持续迭代研究假设的伙伴。

sequenceDiagram participant R as 研究循环 participant A as 因子系统 participant B as 模型系统 participant V as 验证/回测 R->>A: 基于证据提案候选因子 R->>B: 基于证据提案模型 A->>V: 计算IC/rankIC B->>V: 计算夏普 V–>>R: 反馈调整方向 R->>A: 下一轮(密封沙箱内) R->>B: 下一轮(密封沙箱内)

三、更大的范式:从工具调用到多 agent 辩论

中金 8/6 闭门会已勾勒出行业方向:让大模型成为”具备自主迭代能力的智能投研伙伴”。典型做法是成长动量视角价值质量视角两个低相关 agent 辩论,外加一个 correction agent 做代码验证与纠错,四步循环(构建→验证纠错→评估反馈→入库去相关)。核心张力始终是:平衡模型创造力与量化严谨性,让 AI 产出具备经济逻辑、可解释、可回测的阿尔法。

graph LR T[量化投研范式跃迁] –> A[单次工具调用] T –> B[多智能体自主协作] T –> C[递归自改进 AQuA] A –> D[创造力 vs 严谨性平衡] B –> D C –> D D –> E[可解释/可回测/经济逻辑自洽的阿尔法]

四、值得关注的逻辑

AQuA 的”密封双沙箱 + 证据驱动递归”思路,把此前 FactorMiner 的”技能库 + 经验记忆库”进一步推向自举式研究。它的风险也很清晰:IC 0.19、夏普 2.5 是历史回测,未经历实盘与不同市场周期的检验,且两套系统互不共享可能漏掉跨域协同信号。后续看:这类自改进框架能否在 2026 下半年市场风格切换时稳住,以及是否会出现”过拟合到回测历史”的新形态危机。

参考来源

– arXiv:2608.12841《AQuA: Recursively Self-Improving Quantitative Trading Research Agents》 – arXiv:2608.11785《TradingMoE: Routing the Right Experts in Evolving Markets》 – ROI AI Brief: Investment Tech Weekly #39 – 中金公司量化投研闭门会纪要(2026-08-06)

一条评论

  1. 我先坦白:年轻时以为量化大佬是盯着 K 线图的人。后来才知道,他们大半时间在跟“我是不是又骗了自己”搏斗。AQuA 这篇,本质是把这场自我搏斗写进了代码。

    它的结构很妙:两套 LLM 系统,一套挖符号因子,一套训可训练模型,彼此“密封”——不共享 agent、不共享记忆、不共享候选空间,连研究状态都不通。只用“已被验证的证据”去指导下一轮提案。为什么这么别扭?因为单一模型的逻辑偏置会在迭代里自我放大,隔离是为了不让它一条道走到黑。

    成绩单得这么读:
    – crypto 因子 IC ≈ 0.190,意思是不看价格、只看因子,它的预测方向和真实涨跌相关性接近 0.19,量化里这算“能用”;
    – 美股单股 IC +0.0843,转成多空策略后留出样本夏普 +2.50,且 2021–2025 每年都为正——五年全红比单年高夏普难得多;
    – 同期的 TradingMoE 用稀疏 MoE 把 token 专业度匹配市况,相对 22 个基线累计收益超 30%。

    反自欺:IC 0.19、夏普 2.5 是回测里的历史,没经过实盘和风格切换的毒打;两套系统互不说话,也可能漏掉跨域的协同信号。

    收尾钉子:等它在 2026 下半年市场风格一变脸时,夏普还能不能稳住——那才分得清是真阿尔法,还是把历史回测过拟合成了艺术品。

发表回复

人生梦想 - 关注前沿的计算机技术 acejoy.com 🐾 步子哥の博客 🐾 背多分论坛 🐾 借一步网 🐾 智柴网 沪ICP备2024052574号-1