研读 / Quantocracy 2026 · 快照 2026-09-07

年度研究目录与分层解读

合计 386 条目录:374 条 Quantocracy 收录,12 篇补充研究;154 篇有导读。目录覆盖不等于正文读完。无账号、无脚本也可离线阅读;浏览器查找可全文搜索,打印可保存 PDF。

打开可筛选的在线研究看板 ↗

推荐分 = 问题价值 30 + 证据 30 + 方法 25 + 复现 15;未评价用“待评”,分数不是正确概率、投资评级或收益预测。

全年目录(收录日期降序)

按 Quantocracy 收录日纳入;补充论文置后。不含可转债主题。
日期 / 来源文章阅读状态推荐
2026-09-06
Investment Idiocy
Carver 新书把仓位、成本和交易管理放到台前;它是培训线索,不是新策略论文
回测与研究方法
导读完成57
2026-09-06
Dead Signals Lab
夏普从 0.63 归零:先修复历史成分名单,才有资格讨论股票信号
数据与信息处理
导读完成88
2026-09-06
Quanter Lab
财报后漂移:9.6 个百分点的组间优势,调整市场敞口后只剩 0.1
信号与收益预测
导读完成88
2026-09-06
Quantpedia
100 个 AI 投资人格年化 29.5%,却与一个普通提示的选股重合 92%
AI / 大模型基础能力
导读完成85
2026-09-06
Quanter Lab
PEAD 平均年收益从 −0.5% 变 +2.2%:入场日期变了,实际上连组合定义也变了
策略与交易
导读完成88
2026-09-06
Quantish
AI 研究系统的核心不是多跑回测,而是阻止错误结果进入决策
回测与研究方法
导读完成83
2026-09-06
Macrosynergy
Gold and macro factors
信号与收益预测
已收录待评
2026-09-06
Alpha Architect
What Daily Stock Returns Tell Us About the Economy
待分类
已收录待评
2026-09-03
Spatium Novum
CAPM after Markowitz: Portfolio Choice Meets the Market
组合与风险
已收录待评
2026-09-03
Strat Proof
十币周频动量只有 0.37 夏普;但这次“复现失败”本身也有成本和口径问题
策略与交易
导读完成69
2026-09-03
Vertox Quant
EigenScore 是量化编程练习场,不是用 Elo 证明投资能力的研究论文
回测与研究方法
导读完成54
2026-09-03
Quanter Lab
Dalio Holy Grail walked 2008-2025
待分类
已收录待评
2026-09-02
Paper to Profit
隔夜轮动号称每年翻倍;90 日选股并不自动消除筛选偏差和开收盘成交风险
策略与交易
导读完成64
2026-09-02
Jonathan Kinlay
纯噪声也能被 AI 做出 2.12 夏普:不仅要记录试了多少,还要记录拼了多少
回测与研究方法
导读完成93
2026-09-02
Quanter Lab
All Weather built and tested against inverse vol, ERC and a 60/40
待分类
已收录待评
2026-09-02
Aligrithm
股债相关从正转负确实改变风险,但“负相关拖累收益”是需要纠正的叙述
组合与风险
导读完成74
2026-09-02
Jan Heger
总结果过关,年份与排名却露馅:别让自动判决替你停止思考
回测与研究方法
导读完成74
2026-09-02
Aligrithm
比特币高波动会延续,但 96% 的状态留存里藏着滚动窗口重叠
组合与风险
导读完成75
2026-08-31
Allocate Smartly
月度 TAA 改成每日全仓调仓:毛收益没改善,额外成本却超过每年 2%
组合与风险
导读完成81
2026-08-31
Michael Emre Tulum
Dual Momentum for a Collapsing Currency
策略与交易
已收录待评
2026-08-31
Alpha Architect
Can ChatGPT Forecast Stock Price Movements?
信号与收益预测
已收录待评
2026-08-29
Quantpedia
Boundary 不是“贵了就卖”:它判断的是趋势在估值极端处是否更容易反转
信号与收益预测
导读完成88
2026-08-29
Trading the Breaking
Podcast: From market problems to quantitative trading systems
策略与交易
已收录待评
2026-08-27
Quanter Lab
Magic Formula tested against each half: quality alone beat the combination
待分类
已收录待评
2026-08-27
Equibles
What Happens After Congress Buys or Sells a Stock? Evidence...
待分类
已收录待评
2026-08-27
Aligrithm
Crypto Isn't Structurally Alien: Roll/VPIN/Amihud Predict Distribution Shifts
信号与收益预测
已收录待评
2026-08-26
Spatium Novum
Markowitz, Estimation Error and 1/N
组合与风险
已收录待评
2026-08-25
Aligrithm
FX Edge Lives in Other Markets (cross-asset series)
待分类
已收录待评
2026-08-25
Quant Insti
Form 4 Insider Trading in Python: A Filing-Date Event Study
策略与交易
已收录待评
2026-08-24
Quanter Lab
The Crash Switch Worked and the Strategy Starved Anyway: Keller's Menu Tested
策略与交易
已收录待评
2026-08-24
Portfolio Optimizer
Sharpe 相同,不代表每一段时间都赚得一样稳
回测与研究方法
导读完成82
2026-08-23
Beyond Passive
The Safe Assets: 150 Years of Bonds and Gold Across Sixteen Countries
待分类
已收录待评
2026-08-23
Aligrithm
Does Complexity Actually Help? The Virtue-of-Complexity Autopsy
待分类
已收录待评
2026-08-22
Quanter Lab
Regime-Based Sector Rotation Beats the Index at Full Deployment
待分类
已收录待评
2026-08-22
Macrosynergy
Wealth management with macro factors
信号与收益预测
已收录待评
2026-08-20
TradeQuantiX
Momentum Mini-Portfolio Development - Part 2: USA Pullback Momentum
组合与风险
已收录待评
2026-08-20
Jan Heger
赢过 80 个随机价位仍不够:两跳滑点让 PF 从 1.34 缩到 1.07
回测与研究方法
导读完成79
2026-08-20
Aligrithm
Metaheuristics for Rule Optimization — With Diversity as the Guardrail
待分类
已收录待评
2026-08-19
Aligrithm
Model-Based or Data-Mined: Lotter's Framing of the Whole Problem
待分类
已收录待评
2026-08-18
Quantpedia
Sectoral Intramonth Momentum Cycle: Exploiting Turn-of-the-Month Patterns in Sector ETF Strategies
策略与交易
已收录待评
2026-08-16
Jonathan Kinlay
AI 因子确实拥挤,但不能因此断定是模型权重造成的
回测与研究方法
导读完成86
2026-08-16
Aligrithm
Price-Path Convexity: A New Cross-Sectional Anomaly
信号与收益预测
已收录待评
2026-08-15
Aligrithm
Dual Momentum Between Gold and Bitcoin (Two Stores of Value)
策略与交易
已收录待评
2026-08-15
Alpha Architect
VIX and Trend Following Revisited: Nearly a Decade of Out-of-Sample Evidence
策略与交易
已收录待评
2026-08-15
Aligrithm
Factor Timing Mostly Fails — the Honest Version
信号与收益预测
已收录待评
2026-08-15
Krzysztof Ozimek
夏普估计不一定是钟形曲线;但拟合 5,000 次重抽样不等于拥有 5,000 份市场证据
回测与研究方法
导读完成63
2026-08-15
Relative Value Arbitrage
Market Regimes and Changing Market Dynamics
待分类
已收录待评
2026-08-12
Aligrithm
How to Spot a Fake ML Trading Paper
回测与研究方法
已收录待评
2026-08-12
Jan Heger
分批止盈让盈利变亏损?这篇案例最大的疑点是只改赢家、不重放路径
策略与交易
导读完成58
2026-08-12
Morgue Labs
议员 ETF 跑赢 SPY 近 13 点,扣掉更高 Beta 后 Alpha 却接近零
组合与风险
导读完成80
2026-08-12
Concretum Group
The Rise of CTA ETFs
待分类
已收录待评
2026-08-11
Morgue Labs
长期买虚值期权会付出波动溢价,但“月亏 68%”不能代替真实期权链检验
策略与交易
导读完成57
2026-08-11
Tommi Johnsen
新闻正负组次日差 0.45%,但只有三篇以上报道的公司日才出现
数据与信息处理
导读完成81
2026-08-11
Aligrithm
Stop Using Pairwise Granger: PCMCI for Financial Causality
待分类
已收录待评
2026-08-11
Alex Chinco
Excessively Volatile? Or Inexplicably Precise?
待分类
已收录待评
2026-08-09
Beyond Passive
150 Years of Global Stock Returns - The Birthplace Lottery
待分类
已收录待评
2026-08-09
Aligrithm
Bid-Ask Spread From OHLC: The GMM Estimator That Beats Roll/CS
待分类
已收录待评
2026-08-09
Macrosynergy
Bond indices and systematic duration management
待分类
已收录待评
2026-08-09
Krzysztof Ozimek
策略 B 是否优于 A,要看收益分布;但事后市场状态不是可提前下单的信号
回测与研究方法
导读完成77
2026-08-09
Alpha Architect
Skewness as a Hidden Driver of Anomaly Returns
信号与收益预测
已收录待评
2026-08-06
Allocate Smartly
Taming the Wildcard: David Varadi's "Inflation Compass"
待分类
已收录待评
2026-08-06
Quantt
Testing for Mean Reversion: ADF, Hurst Exponent and Half-Life
策略与交易
已收录待评
2026-08-06
Aligrithm
The Mathematics of Machine Learning, for Traders
待分类
已收录待评
2026-08-06
Quantt
The Ornstein-Uhlenbeck Process in Finance: Theory, Simulation and Calibration
待分类
已收录待评
2026-08-05
Jan Heger
触及整数位概率多 14.7 个百分点,为什么还不是能赚钱的交易?
回测与研究方法
导读完成74
2026-08-04
Aligrithm
The Signal Ceiling: Why No Single-Bar OHLCV Edge Beats Costs in MNQ
信号与收益预测
已收录待评
2026-08-04
Paper to Profit
五资产月度轮动规则很简单;12.5 万次搜索才是 11% 年化背后的关键成本
组合与风险
导读完成66
2026-08-03
Quantitativo
Quantitativo weekly #4
待分类
已收录待评
2026-08-03
The Refutation
Supertrend 一小时亏 92.9%:换成四小时赚钱,也不等于入场信号有效
策略与交易
导读完成74
2026-08-03
Quantifiable Edges
六七月连跌后,13 次九月有 11 次下跌;小样本季节性不是 85% 的预测概率
信号与收益预测
导读完成55
2026-08-02
Vertox Quant
给波动预测加 90% 区间很有用,但示例代码把测试段用于早停了
AI / 大模型基础能力
导读完成86
2026-08-02
Relative Value Arbitrage
Making Option Pricing Models More Practical
策略与交易
已收录待评
2026-07-31
Jan Heger
58.4% 胜率通过四道检验,却死在限价单成交规则上
回测与研究方法
导读完成86
2026-07-31
Aligrithm
LAFO 的贡献是定义价格滤波目标,不是证明夏普 11 的反转策略
信号与收益预测
导读完成76
2026-07-31
The Refutation
50/100 均线带的 55 种交易版本:视觉上的趋势,未能跨过手续费
策略与交易
导读完成75
2026-07-30
Aligrithm
比特币“美股隔夜收益”预测 VIX:关键是时间切分,而不是币价全天涨跌
信号与收益预测
导读完成81
2026-07-29
Paper to Profit
先换采样时钟再换指标:2,021种新K线的胜出者,仍缺公开公式
数据与信息处理
导读完成67
2026-07-29
Delphic Alpha
Path Signatures: Does the Shape of Price Paths Predict Returns?
信号与收益预测
已收录待评
2026-07-29
Quantpedia
A Microstructural Account of the Demise of Short-Term Trend-Following
策略与交易
已收录待评
2026-07-29
Concretum Group
宏观事件日历真正有用的是时点骨架,不是“事件越多越赚钱”
数据与信息处理
导读完成83
2026-07-29
Rulyfi
同一根 K 线先止盈还是先止损:82.54% 的乐观盈利配置过不了压力测试
回测与研究方法
导读完成89
2026-07-29
Aligrithm
用标普超卖信号择时空波动率,比反过来读 VIX 更有用吗?
策略与交易
导读完成73
2026-07-29
Concretum Group
When Risk Is Not Rewarded
待分类
已收录待评
2026-07-29
Trading the Breaking
Podcast: Why I stopped trying to predict the market
信号与收益预测
已收录待评
2026-07-27
CSS Analytics
The Inflation Compass Model
待分类
已收录待评
2026-07-27
Handelsmeisterei
Crafting a Trading Strategy
策略与交易
已收录待评
2026-07-27
Portfolio Optimizer
The NAAIM-AAII Equities Allocation Spread: Smart Money Relative Sentiment Indicator
组合与风险
已收录待评
2026-07-27
Krzysztof Ozimek
不要只给策略一个分数,但“熊市机器学习更好”在这里是事后解释,不是择时模型
回测与研究方法
导读完成82
2026-07-25
Quantitativo
Network Momentum
策略与交易
已收录待评
2026-07-25
Aligrithm
Momentum Is a Ranking Problem: Learning-to-Rank vs Regress-then-Rank
策略与交易
已收录待评
2026-07-25
Beyond Passive
给炼油策略加 Carry,价值不只分散:小账户更需要一个不爱交易的信号
组合与风险
导读完成83
2026-07-25
Macrosynergy
Portfolio optimization with macro factors and neural networks
组合与风险
已收录待评
2026-07-25
Capital Spectator
Research Review | 24 July 2026 | Strategy Analytics
策略与交易
已收录待评
2026-07-23
Rulyfi
先改入场还是出场?胜率看止盈止损,样本外表现却主要取决于两者配合
回测与研究方法
导读完成85
2026-07-23
Quantpedia
Getting the Target Right in Return Prediction
信号与收益预测
已收录待评
2026-07-23
Relative Value Arbitrage
Algorithmic Trading, HFT, and Market Stability
策略与交易
已收录待评
2026-07-21
Paper to Profit
I Mastered Chaos Theory to Develop a 3.275 Sharpe FX Strategy
回测与研究方法
已收录待评
2026-07-21
Aligrithm
Can Machines Learn Weak Signals? Ridge > Zero > Lasso
信号与收益预测
已收录待评
2026-07-21
Delphic Alpha
Daily Long/Short Trend Following: Parameters, Asset Classes, and Universe Depth
策略与交易
已收录待评
2026-07-21
Flash Alpha
193 个 SPY 周三并不足以证明 0DTE“稳定贵13%”:分布假设和尾部更重要
组合与风险
导读完成73
2026-07-21
The Refutation
RSI 70/30 是价格状态标签,不能自动变成反转预测
信号与收益预测
导读完成75
2026-07-21
Quantitativo
Quantitativo weekly #3
待分类
已收录待评
2026-07-21
The Refutation
MACD 看起来有效,可能是旁边的趋势过滤器在赚钱
回测与研究方法
导读完成80
2026-07-18
Allocate Smartly
融资余额创新高不等于卖点:醒目的历史图,只有三个已完成事件
回测与研究方法
导读完成75
2026-07-18
Concretum Group
Timing Equity Factors with Momentum
信号与收益预测
已收录待评
2026-07-18
Aligrithm
Percentile-Rank Momentum With Hysteresis: Low-Churn Signals
信号与收益预测
已收录待评
2026-07-18
Beyond Passive
同一炼油策略,100 万美元净夏普 1.25,1 万美元却 −1.3:最低佣金改变执行方式
策略与交易
导读完成81
2026-07-18
Alpha Architect
Two Accounting Anomalies: One May Be Risk, the Other Is Mispricing
信号与收益预测
已收录待评
2026-07-16
Aligrithm
State-Space Models for Price: CryptoMamba vs Transformers (Skeptical)
待分类
已收录待评
2026-07-16
Trading the Breaking
How quants separate edge from noise
待分类
已收录待评
2026-07-16
Quantpedia
Can AI Do Financial Research?
待分类
已收录待评
2026-07-16
Tommi Johnsen
新闻 AI 的漂亮收益怎样消失:补齐回报、修正并列排序后,次日信号不再成立
回测与研究方法
导读完成90
2026-07-14
Allocate Smartly
抄底陷入回撤的策略,可能只是撞上所有策略都更好做的月份
组合与风险
导读完成85
2026-07-14
Paper to Profit
Moving Averages and Harness Engineering for +33% CAGR on Portfolio Optimization
组合与风险
已收录待评
2026-07-14
Rulyfi
RMP 不是赚钱概率:它把单次显著性抬高到整个搜索的幸运冠军门槛
回测与研究方法
导读完成83
2026-07-13
Alpha Architect
The Intramonth Momentum Cycle
策略与交易
已收录待评
2026-07-12
Aligrithm
Network Momentum as a Cross-Asset Factor
信号与收益预测
已收录待评
2026-07-12
Quantitativo
五篇研究共同提醒:组合平均收益,会把行业、拥挤与市场状态混在一起
组合与风险
导读完成66
2026-07-12
Aligrithm
Trend-Following P&L Is a Function of Autocorrelation (Closed Form)
组合与风险
已收录待评
2026-07-12
Trading the Breaking
Feature selection: Wrapper-based feature selection methods
待分类
已收录待评
2026-07-10
Beyond Passive
裂解价差领先炼油股:毛夏普 1.48 的产业链信号,不能直接叫市场中性 Alpha
信号与收益预测
导读完成84
2026-07-10
Rulyfi
同一笔交易,DSR 从0.035变0.919:改变的是搜索参照总体,不是策略变强
回测与研究方法
导读完成84
2026-07-10
Rulyfi
一亿回测筛出3,130个候选,不等于发现3,130个Alpha
回测与研究方法
导读完成81
2026-07-09
Tradevo Data
财务因子的“提前66天”:改公告日期还不够,修订值也不能穿越
数据与信息处理
导读完成87
2026-07-09
Concretum Group
Quantitative Value
待分类
已收录待评
2026-07-09
Cracking Markets
Intraday Breakout Details That Matter: Exits, Slippage and 0DTE Options
策略与交易
已收录待评
2026-07-09
Tommi Johnsen
把 Claude 调得更像分析师后,相关系数由 +0.24 变 −0.06;但后续审计削弱了收益结论
AI / 大模型基础能力
导读完成82
2026-07-06
TradeQuantiX
Building the Market Effect Mini-Portfolio
组合与风险
已收录待评
2026-07-06
Quantitativo
Quantitativo weekly
待分类
已收录待评
2026-07-06
Relative Value Arbitrage
The Market Impact of Retail Options Trading
策略与交易
已收录待评
2026-07-04
Jdiv930
Your Backtest Is Lying to You: Building a Walk-Forward Validation Harness in Python
回测与研究方法
已收录待评
2026-07-04
Investment Idiocy
Jumping back in the pool(ing): pooling by asset class and portfolio weight distance
组合与风险
已收录待评
2026-07-04
Financial Hacker
三盏风险灯决定 SPY 仓位:8% 年化背后,先看减仓是否真有增量
组合与风险
导读完成82
2026-07-02
Quantpedia
Silicon vs. Satoshi: Tactical Asset Rotation Between NASDAQ-100 and Bitcoin
待分类
已收录待评
2026-06-30
Quantpedia
Guardrails Make the Researcher: What an AI Agent Got Right (And Wrong)
待分类
已收录待评
2026-06-29
Investment Idiocy
One of These Things Is Not Like the Others. Or is it? Pooling rule p&l estimates
待分类
已收录待评
2026-06-29
Investment Idiocy
Rolling, rolling, rolling.... updating statistical estimates yes or no
待分类
已收录待评
2026-06-28
Beyond Passive
Trend Following (4/4): The Poor Man’s Trend Program
策略与交易
已收录待评
2026-06-28
Concretum Group
Estimating the Capacity of a Trading Strategy
策略与交易
已收录待评
2026-06-28
Macrosynergy
Systematic FX trading with regression learning and transaction cost analysis
策略与交易
已收录待评
2026-06-28
Alpha Architect
The Impressive Markets Hypothesis: Prices Still Know the Future
待分类
已收录待评
2026-06-25
Quantpedia
Why Mean-Variance Optimization Breaks Down
待分类
已收录待评
2026-06-25
Quant Insti
FX Trend-Following: A Walk-Forward Validation Study
策略与交易
已收录待评
2026-06-24
Investment Idiocy
Breaking Badly: finding the structural breaks in parameter estimates
待分类
已收录待评
2026-06-24
Concretum Group
Global Tactical Asset Allocation, Automated With Python and IBKR
组合与风险
已收录待评
2026-06-24
Tommi Johnsen
News and earnings sentiment agree, mostly at the extremes
信号与收益预测
已收录待评
2026-06-24
Eran Raviv
变量比样本还多时,协方差估计的第一步是选假设,不是直接求逆
组合与风险
导读完成57
2026-06-21
Quantpedia
Why Most Portfolios Are Under Diversified
组合与风险
已收录待评
2026-06-21
Concretum Group
Should You Trade Thin Stocks?
待分类
已收录待评
2026-06-19
Investment Idiocy
To Cluster Or Not To Cluster That is the Question...
待分类
已收录待评
2026-06-19
Anton Vorobets
Academic Confirmation Bias
待分类
已收录待评
2026-06-17
Quantpedia
Testing an AI-Assisted Research Workflow for Multi-Asset Pullback Strategy Discovery
策略与交易
已收录待评
2026-06-17
Investment Idiocy
Honey I shrunk the weights (instead of the inputs!)
待分类
已收录待评
2026-06-17
Portfolio Optimizer
Value-at-Risk Estimation: Improved Estimates with the Harrell-Davis Quantile Estimator
待分类
已收录待评
2026-06-16
Quantt
The Sharpe Ratio of Pure Noise
回测与研究方法
已收录待评
2026-06-16
Quantpedia
Dual vs. Single Momentum in Commodities: Enhancing Risk-Adjusted Returns
策略与交易
已收录待评
2026-06-16
Concretum Group
Automating a Volatility Strategy With Python and Interactive Brokers
策略与交易
已收录待评
2026-06-16
Investment Idiocy
FIFA* (*Fitting and Forecasting Actual data) Portfolio Optimisation competition with real returns
组合与风险
已收录待评
2026-06-16
Trading the Breaking
Feature selection: Filter-based methods
待分类
已收录待评
2026-06-16
Quant Galore
A Common Sense Guide to Volatility Trading
策略与交易
已收录待评
2026-06-16
TradeQuantiX
Market Effect Research: Turnaround Tuesday Effect
待分类
已收录待评
2026-06-16
Relative Value Arbitrage
Why System Validation Matters More Than Ever
待分类
已收录待评
2026-06-16
Alpha Architect
Dividend Timing and Global Dividend Premium
待分类
已收录待评
2026-06-13
Concretum Group
A Hidden Trade Around SpaceX IPO?
待分类
已收录待评
2026-06-13
Alpha Architect
The Factor Zoo Has Hundreds of Animals — But Only a Handful of Species
信号与收益预测
已收录待评
2026-06-12
Algorithmic Advantage
The Right Way to Use AI in Trading (This Week)
策略与交易
已收录待评
2026-06-12
Peter Olayemi
I Audited 30 Years of SPY Candlesticks and the Variance Risk Premium
待分类
已收录待评
2026-06-10
Vertox Quant
Fast Option Pricing using Fourier Transform
策略与交易
已收录待评
2026-06-09
Investment Idiocy
Forecasting statistical estimates when data gets real
信号与收益预测
已收录待评
2026-06-09
Robot Wealth
Resourcing a Triangulated Stat Arb Operation as a Solo Trader
待分类
已收录待评
2026-06-09
Beyond Passive
What Trend Following Actually Adds to a Risk-Premia Core
策略与交易
已收录待评
2026-06-09
Investment Idiocy
UFC - Ultimate Fitting Championships
待分类
已收录待评
2026-06-09
Tommi Johnsen
When the insiders and the news disagree: a first look at the cross-signal
信号与收益预测
已收录待评
2026-06-09
Quantpedia
Reconstructing a Century of U.S. Corporate Bonds
待分类
已收录待评
2026-06-06
Investment Idiocy
The crossword puzzle of fitting - why across and then down?
待分类
已收录待评
2026-06-06
Concretum Group
The Non-Linear Costs of Trading
策略与交易
已收录待评
2026-06-06
Quantpedia
How Wise is the Crowd in Prediction Markets
信号与收益预测
已收录待评
2026-06-06
Capital Spectator
Research Review | 5 June 2026 | Risk Management
待分类
已收录待评
2026-06-04
Implementing QuantLib
The software side of replication
待分类
已收录待评
2026-06-04
Relative Value Arbitrage
Does Regression Still Work in Modern Markets?
待分类
已收录待评
2026-06-04
Allocate Smartly
一条策略年化14.5%,QQQ贡献3.1个百分点:收益归因比只看净值多回答了什么
组合与风险
导读完成70
2026-06-02
Beyond Passive
Trend following (2/4): Sector-by-sector replication
策略与交易
已收录待评
2026-06-01
Robot Wealth
When Is a Mispricing Not a Mispricing?
待分类
已收录待评
2026-06-01
Wisdom Trading
AI Overfitting in Trading Systems
回测与研究方法
已收录待评
2026-06-01
Allocate Smartly
提款率7%未必胜过5%:样本越短,最坏退休路径越可能被漏掉
组合与风险
导读完成70
2026-06-01
TradeQuantiX
Market Effect Research: Holiday Seasonality - Part 2
待分类
已收录待评
2026-06-01
Alpha Architect
Institutions’ return expectations across assets and time
信号与收益预测
已收录待评
2026-05-30
Concretum Group
交易程序没报错也可能已经失控:行情新鲜度、账户净额与重启对账才是上线底线
回测与研究方法
导读完成83
2026-05-30
Beyond Passive
Trend following (1/4): Replicating your own program
策略与交易
已收录待评
2026-05-30
Concretum Group
同一批日内做空候选,改为隔夜做多年化37.1%:省去借券,却接回跳空风险
策略与交易
导读完成65
2026-05-30
Alpha Architect
Trend-Following Filters – Part 10
策略与交易
已收录待评
2026-05-30
Macrosynergy
The Sharpe stability ratio of trading strategies
回测与研究方法
已收录待评
2026-05-27
Quantpedia
2026量化研究奖前三名:动量权重、月内周期与LLM假设发现,但奖项不是收益验证
回测与研究方法
导读完成41
2026-05-27
Algorithmic Advantage
Martyn Tinsley - Walk Forward Correlation: A New Tool for Robust Strategy Design
组合与风险
已收录待评
2026-05-27
Tommi Johnsen
内幕人买入信号的首要问题是何时能看到:四个集群前一天已涨1.61%
数据与信息处理
导读完成66
2026-05-24
Robot Wealth
不再一对一配股:把价差网络压成个股信号,再在组合层面对冲
策略与交易
导读完成74
2026-05-24
Quantpedia
每周挑3只ETF,10周与25周动量各一半:规则简单,参数选择并未消失
组合与风险
导读完成75
2026-05-24
Concretum Group
跳空高开日内做空年化98%,但67%回撤、借券摩擦和2022后失效不能跳过
策略与交易
导读完成62
2026-05-24
Chase the Devil
三次迭代逼近机器精度还不够:隐波求解器最终卡在浮点边界和定价函数
回测与研究方法
导读完成82
2026-05-24
Alpha Architect
When Everyone Trades the Same Factor Playbook
信号与收益预测
已收录待评
2026-05-20
Concretum Group
VWAP退出的夏普最高,却不是每年赢家:四种出场规则该如何选
策略与交易
导读完成79
2026-05-20
Quantpedia
把新兴市场历史延到1926年:合成日收益不能当成新增的真实市场经验
数据与信息处理
导读完成60
2026-05-20
TradeQuantiX
Market Effect Research: Turn of the Month Effect
待分类
已收录待评
2026-05-20
Tommi Johnsen
1199条新闻只有106条被判有方向,而FinBERT把其中44条提前判成中性
数据与信息处理
导读完成80
2026-05-20
Quantpedia
散户猜对51.3%却亏钱,机器人猜对49.9%却赚1.33亿美元:入场价比胜率重要
策略与交易
导读完成83
2026-05-20
Relative Value Arbitrage
Volatility Derivatives and VIX Market Dynamics
策略与交易
已收录待评
2026-05-17
Jonathan Kinlay
Agentic Workflows for Alpha Research
待分类
已收录待评
2026-05-17
Beyond Passive
An Active Hedge for the EUR Investor
策略与交易
已收录待评
2026-05-17
Quantpedia
商品期货155年风险溢价约5.4%:关键不是商品一直涨,而是期货与现货不同
组合与风险
导读完成79
2026-05-17
Quantifiable Edges
六周暴涨后一年平均涨18.8%,但“历史最强20次”本身是事后排序
信号与收益预测
导读完成61
2026-05-14
Vertox Quant
The Effective Number of Tested Strategies
回测与研究方法
已收录待评
2026-05-14
Alvarez Quant Trading
翻倍股占比仅为科技泡沫时的四成,但这不是市场还能涨多少的尺子
信号与收益预测
导读完成58
2026-05-12
Allocate Smartly
给策略净值加均线开关:回撤变小,风险调整收益却没有普遍改善
组合与风险
导读完成80
2026-05-11
Algorithmic Advantage
Martyn Tinsley - Beyond the BackTest
回测与研究方法
已收录待评
2026-05-11
Tommi Johnsen
A Day Is Now What a Decade Used to Be
待分类
已收录待评
2026-05-10
Portfolio Optimizer
用经理平均仓位替代固定60/40,年化7.9%变9.1%,但股票敞口也多了6个百分点
组合与风险
导读完成76
2026-05-10
Beyond Passive
The Currency You Didn’t Choose
待分类
已收录待评
2026-05-10
Quant Insti
AI Forex Backtesting with LLM Regime Labels: DeepSeek vs KMeans in Python
回测与研究方法
已收录待评
2026-05-10
Jonathan Kinlay
Reinforcement Learning for Optimal Execution
策略与交易
已收录待评
2026-05-10
Hanguk Quant
Designing State-of-the-Art Logging in Python
待分类
已收录待评
2026-05-10
Alpha Architect
Why Momentum Investing Has Been Struggling—And What Volatility Has to Do With It
策略与交易
已收录待评
2026-05-06
Allocate Smartly
追最近高夏普的TAA策略:12个月窗口有亮点,却在2011年后失去优势
组合与风险
导读完成77
2026-05-06
Quantpedia
黄金与比特币轮动年化64.7%,降风险后只剩12.0%:暴露调整才是故事关键
组合与风险
导读完成74
2026-05-06
Alvarez Quant Trading
回撤优化了17%,却只是绕开两笔亏损:一次策略修改的过拟合审计
回测与研究方法
导读完成78
2026-05-06
Quantifiable Edges
问卷择时只投资19%的时间,周频回撤不到10%,日频却达到25%
信号与收益预测
导读完成76
2026-05-06
Tommi Johnsen
新闻情绪不是一个因子:拆成数字、事件、分析师后,行业方向甚至相反
信号与收益预测
导读完成68
2026-05-05
Quantpedia
没持有比特币,也可能持有同一批投机者:关注因子是在找隐藏共振
组合与风险
导读完成71
2026-05-04
Jonathan Kinlay
Deep Learning for Volatility Surface Repair
策略与交易
已收录待评
2026-05-04
Krzysztof Ozimek
New Contributor: Modeling Asymmetric Volatility With EGARCH
策略与交易
已收录待评
2026-05-04
Quantifiable Edges
五月首日上涨后,25次中17次四日后下跌:季节性线索还不是交易策略
信号与收益预测
导读完成53
2026-05-04
Relative Value Arbitrage
Overfitting and Parameter Selection in Trading Strategies
回测与研究方法
已收录待评
2026-05-03
Strat Proof
22条加密策略纸面前测16条亏损,但“累计−2081%”并不是账户收益
回测与研究方法
导读完成58
2026-05-03
Beyond Passive
风险平价最痛的月份不是普通坏日子的简单累加:股债共跌占比明显上升
组合与风险
导读完成81
2026-05-03
Chase the Devil
隐含波动率“几乎显式”公式并不等于更快:尾部测试慢了一个数量级
回测与研究方法
导读完成83
2026-05-03
Alpha Architect
Rethinking Trend Following: Optimal Regime-Dependent Allocation
组合与风险
已收录待评
2026-05-03
Macrosynergy
Curve trades with macroeconomic signals
信号与收益预测
已收录待评
2026-04-29
Allocate Smartly
追最近最赚钱的策略:绝对收益更高,但风险调整后没有增加价值
组合与风险
导读完成82
2026-04-29
Robot Wealth
让 AI 多跑一千次回测,并不会自动增加对市场的理解
回测与研究方法
导读完成68
2026-04-29
Quantpedia
做空标普尾部成分失败;反过来做赚了钱,却还不能证明是指数资金效应
策略与交易
导读完成70
2026-04-29
Tommi Johnsen
事实没变,FinBERT 却改口:97.2% 的分类准确率经改写攻击降至 71.0%
AI / 大模型基础能力
导读完成82
2026-04-27
Quantt
Lazy Prices 的 22% 是旧论文结果,不是把年报接入大模型后的新 Alpha
数据与信息处理
导读完成77
2026-04-26
Beyond Passive
58 年股债金配置:波动可预测,不代表逆波动权重就是风险平价
组合与风险
导读完成77
2026-04-25
Alpha Architect
动量跳过最近一个月:行业组合中,它放大了状态差异,而非稳定改善收益
信号与收益预测
导读完成84
2026-04-25
Quant Insti
PCA 保留九成方差,不等于保留九成 Alpha:无监督学习教程该怎样用
AI / 大模型基础能力
导读完成68
2026-04-25
Capital Spectator
预测市场研究综述把三种问题放在一起:概率校准、交易收益与信息优势不是一回事
策略与交易
导读完成69
2026-04-22
Vertox Quant
先让整套研究流程在无信号数据上失败,再相信它在真实市场的成功
回测与研究方法
待获取全文87
2026-04-22
TradeLock 锁定的是事前信号记录,不是证明实盘成交和可实现收益
回测与研究方法
导读完成63
2026-04-22
Relative Value Arbitrage
日内买波动、隔夜卖波动?先看互换损益口径,再谈能否交易
组合与风险
导读完成83
2026-04-20
Portfolio Optimizer
美股占全球组合71%,能反推出投资者预期美股多赚多少吗?
组合与风险
导读完成84
2026-04-20
Quantpedia
同一个动量策略,只改调仓日,年化就能差 3.48 个百分点
组合与风险
导读完成90
2026-04-19
Beyond Passive
把 TLT 补到 1962 年:可以扩展压力场景,不能把高相关当成无误差历史
数据与信息处理
导读完成82
2026-04-18
Quantpedia
预测市场低位买入:有的年化22%,有的只加10bp成本就由赚转亏
策略与交易
导读完成73
2026-04-18
Macrosynergy
一套通胀信息做六类交易:组合夏普1.3,但不是六个独立Alpha
信号与收益预测
导读完成86
2026-04-18
Financial Hacker
AutoTune 自适应周期:滚动测试仍报约 25% CAGR,但还没证明周期识别真的有用
信号与收益预测
导读完成81
2026-04-17
Vertox Quant
SHAP能解释模型为什么买入,却不能证明这个买入有Alpha
AI / 大模型基础能力
导读完成81
2026-04-16
Tommi Johnsen
FinBERT 先过滤新闻:省下调用费,也可能提前删掉最有用的信号
数据与信息处理
导读完成79
2026-04-16
Anton Vorobets
RayforceDB“快几千倍”是特定工作负载经验,不是通用数据库排名
数据与信息处理
导读完成69
2026-04-16
Investment Idiocy
Carver年度期货赚23.7%,为什么风险调整后仍落后CTA基准?
组合与风险
导读完成81
2026-04-15
Return Stacked
最优叠加组合年化多2个百分点,但跟踪误差7.8%可能先逼投资者退出
组合与风险
导读完成81
2026-04-15
Quantifiable Edges
税日季节性曾经很强:45笔交易净赚11,851美元,但近年优势已明显变弱
策略与交易
导读完成65
2026-04-15
Alpha Architect
把过去12个月拆成财报日与非财报日:动量收益中约一半来自公司特定信息窗口
信号与收益预测
导读完成86
2026-04-13
Allocate Smartly
战术收益率:久期补偿不够就持现金,50% 是历史分位而不是收益率阈值
组合与风险
导读完成79
2026-04-13
Trading the Breaking
Data transformations: Data shape and predictive features
数据与信息处理
已收录待评
2026-04-13
Beyond Passive
稀疏策略怎么配仓:先问给底仓增加了什么,不要把零重叠误认成零风险
组合与风险
导读完成81
2026-04-10
Robot Wealth
趋势还是反转不是关键,关键是收益由谁的行为提供
回测与研究方法
导读完成70
2026-04-10
Alpha Architect
因子过去一个月出现最大单日上涨,之后高MAX组每月多0.32%;但这是因子择时,不是个股信号
信号与收益预测
导读完成87
2026-04-09
Quantpedia
新兴市场与美国轮动:均线组合年化 7.13%,但别把价差择时当成风险中性 Alpha
策略与交易
导读完成76
2026-04-07
Allocate Smartly
增长×通胀行业轮动:年内涨 39%,但不是全天候,更可能夹带市场 Beta
组合与风险
导读完成74
2026-04-07
Relative Value Arbitrage
LLM 会按角色下单,不等于会赚钱:模拟市场也纠正不了所有高估
AI / 大模型基础能力
导读完成76
2026-04-05
Quant Galore
稀释、de-SPAC 与违约做空:事件时点可定义,收益却还不能从公开预览确认
策略与交易
待获取全文51
2026-04-05
Beyond Passive
月末交易:先分清债券季节性和股债反转,再剔除没跑赢随机窗口的腿
策略与交易
导读完成81
2026-04-05
Quantitativo
深度动量:别只选最可能上涨的股票,还要看所有结果的概率与回报
信号与收益预测
导读完成75
2026-04-05
Tommi Johnsen
When Elon Musk Can’t Sleep, Your Portfolio Feels It
组合与风险
已收录待评
2026-04-05
Macrosynergy
缺一个宏观因子就删整行?补缺让回测多出九年,也改变了比较口径
数据与信息处理
导读完成82
2026-04-03
Quantpedia
ChatGPT 做量化:能加快试验,但也会把稳健性检验做成过拟合
AI / 大模型基础能力
导读完成78
2026-03-31
Quantt
Selling Volatility: The Most Seductive Backtest in Finance
回测与研究方法
已收录待评
2026-03-31
Financial Hacker
Coding the largest strategy ever
策略与交易
已收录待评
2026-03-31
Concretum Group
Breaking the Rules of Intraday Trading
策略与交易
已收录待评
2026-03-29
Robot Wealth
Brave New Backtest
回测与研究方法
已收录待评
2026-03-29
Trading the Breaking
Data transformations: Preprocessing time series
数据与信息处理
已收录待评
2026-03-29
Beyond Passive
Fridays for Gold, Tuesdays for Stocks: Two Sides of the Same Fear Cycle
待分类
已收录待评
2026-03-29
Quantpedia
When Crypto Stopped Diversifying: The ETF Regime Shift
组合与风险
已收录待评
2026-03-29
Alpha Architect
Unlocking Hidden Patterns: How Daily Returns Predict Future Stock Performance
信号与收益预测
已收录待评
2026-03-29
Relative Value Arbitrage
Evaluating Option-Based Strategies and Dollar-Cost Averaging
策略与交易
已收录待评
2026-03-23
Jonathan Kinlay
From Hype to Reality: Building a Hybrid Transformer-MVO Pipeline
待分类
已收录待评
2026-03-23
Alpha Architect
Increases CAPE Ratio Predictability with a Simple Adjustment
信号与收益预测
已收录待评
2026-03-22
Beyond Passive
The Friday Gold Trade: A Conditional Edge
待分类
已收录待评
2026-03-22
Macrosynergy
Unlocking relative value across asset classes
待分类
已收录待评
2026-03-22
Alpha Architect
The Return of the King: Trend Following Is Back – But Will It Last?
策略与交易
已收录待评
2026-03-19
Robot Wealth
AI 能加速写回测,但谁来说明这个收益为什么会存在?
回测与研究方法
导读完成64
2026-03-19
Quantpedia
Timing Value vs. Growth: Evidence from 100 Years of Small Value–Large Growth Spread
待分类
已收录待评
2026-03-17
Allocate Smartly
Diversification Has Been a Huge Drag on TAA Performance for 15+ Years
组合与风险
已收录待评
2026-03-17
Investment Idiocy
How to write a tweet that gets over 300k views; and why diversification is probably good
组合与风险
已收录待评
2026-03-16
Quantt
Landing Your First Role - Breaking Into Quant Finance
待分类
已收录待评
2026-03-16
Quantpedia
Anomaly-Based Trading Strategies in the Real Estate Sector. Can the Market Be Beaten?
信号与收益预测
已收录待评
2026-03-16
Edge Alchemy
Brave New Backtest
回测与研究方法
已收录待评
2026-03-16
Financial Hacker
The One Euro Filter
待分类
已收录待评
2026-03-15
Beyond Passive
The Calendar Ensemble: Building an Event-Driven Alpha Overlay
待分类
已收录待评
2026-03-14
Jonathan Kinlay
Transformer Models for Alpha Generation: A Practical Guide
待分类
已收录待评
2026-03-14
Trading the Breaking
Infra: Financial APIs
数据与信息处理
已收录待评
2026-03-12
Quant Galore
A Quant's Guide to Cross-Section Maxxing, Code Included
待分类
已收录待评
2026-03-12
Relative Value Arbitrage
Machine Learning for Derivative Pricing and Crash Prediction
信号与收益预测
已收录待评
2026-03-12
Alpha Architect
The Best Defensive Strategies: Two Centuries of Evidence
策略与交易
已收录待评
2026-03-08
Jonathan Kinlay
Reinforcement Learning for Portfolio Optimization: From Theory to Implementation
组合与风险
已收录待评
2026-03-08
Kris Longmore
AI Will Create Millions of Quants
待分类
已收录待评
2026-03-07
Macrosynergy
宏观信号不缺复杂模型,缺的是约束模型的理由
信号与收益预测
导读完成80
2026-03-05
Quantt
New Contributor: Scaling Python Financial Models on AWS
待分类
已收录待评
2026-03-05
Quantpedia
2-Year Notes Momentum: Extracting Term Structure Anomalies from FOMC Cycles
信号与收益预测
已收录待评
2026-03-05
Portfolio Optimizer
The Market Rank Indicator: Measuring Financial Risk, Part 3
待分类
已收录待评
2026-03-05
Quant Start
Correlated Time Series Generation using Object Oriented Python
待分类
已收录待评
2026-03-05
Tommi Johnsen
Sentiment Analysis Series Part 3: Three Ways the Sentiment Model Can Fail
信号与收益预测
已收录待评
2026-03-02
Robot Wealth
The Winter of our Pairs Trading Discontent: Problems, limitations, frustrations
策略与交易
已收录待评
2026-03-02
Macrosynergy
Systematic FX trading with point-in-time GDP growth estimates
策略与交易
已收录待评
2026-03-02
Alpha Architect
Fund Selection When Borrowing Is Restricted
待分类
已收录待评
2026-03-01
Investment Idiocy
Backtesting course from Rob Carver, March 7 and 8, in person and remote
回测与研究方法
已收录待评
2026-03-01
Jonathan Kinlay
State-Space Models for Market Microstructure
待分类
已收录待评
2026-02-26
Quantpedia
Systematic Allocation in International Equity Regimes
组合与风险
已收录待评
2026-02-24
Quant Start
Time Series Models using Object Oriented Python
待分类
已收录待评
2026-02-24
Quantitativo
More Bets, Better Bets
待分类
已收录待评
2026-02-23
Quantpedia
Evaluating Reversal Potential in Niche Alternative ETFs
待分类
已收录待评
2026-02-23
Trading the Breaking
Infra: Scraping financial data
数据与信息处理
已收录待评
2026-02-23
Relative Value Arbitrage
Do Options Exhibit Momentum?
策略与交易
已收录待评
2026-02-22
Jonathan Kinlay
Kronos and the Rise of Pre-Trained Market Models
待分类
已收录待评
2026-02-21
Yannick Kalber
Break-Even Correlation Thresholds for Linear Predictive Signals
组合与风险
已收录待评
2026-02-21
Capital Spectator
Research Review | 20 February 2026 | Forecasting Returns
信号与收益预测
已收录待评
2026-02-20
Robot Wealth
Moneyball: Finding Undervalued Pairs Using Unconventional Metrics
待分类
已收录待评
2026-02-20
Tommi Johnsen
Can LLMs Beat FinBERT for Stock Sentiment Trading?
信号与收益预测
已收录待评
2026-02-20
Robot Wealth
A Tale of Two Prices
待分类
已收录待评
2026-02-18
Quantpedia
Combining Calendar Strategies into the Trading Portfolio
组合与风险
已收录待评
2026-02-18
Concretum Group
Improving Performance with Fast Alphas; A Tactical Overlay for Intraday Trend Trading
策略与交易
已收录待评
2026-02-16
Yannick Kalber
New Contributor: A Linear Regression's Predictions are a Relevance-Wtd Avg of Past Outcomes
信号与收益预测
已收录待评
2026-02-16
Jonathan Kinlay
Volatility Clustering Across Asset Classes: GARCH and EGARCH Analysis with Python (2015–2026)
策略与交易
已收录待评
2026-02-13
Return Stacked
Why Bonds Still Belong: Rethinking Fixed Income in Modern Portfolios
组合与风险
已收录待评
2026-02-13
Tommi Johnsen
FinBERT Is Wrong 83% of the Time on Positive Headlines: an LLM is Here to Help
待分类
已收录待评
2026-02-13
Macrosynergy
宏观数据修订不仅会制造假信号,也会把真信号藏起来
数据与信息处理
导读完成84
2026-02-11
Allocate Smartly
Why TAA is Performing Well Now: Outperformance Attribution
待分类
已收录待评
2026-02-09
Quantpedia
Pragmatic Asset Allocation Across Market Cycles
组合与风险
已收录待评
2026-02-09
Gautier Marti
EMNLP 2025 in Suzhou
待分类
已收录待评
2026-02-09
Relative Value Arbitrage
Herding in Commodities and Cryptocurrencies
待分类
已收录待评
2026-02-05
Financial Hacker
Build Better Strategies, Part 6: Evaluation
回测与研究方法
已收录待评
2026-02-05
Tommi Johnsen
Stock Sentiment Indicators in U.S. Equities: and the research that supports them
信号与收益预测
已收录待评
2026-02-02
Portfolio Optimizer
More Bootstrap Simulations with Portfolio Optimizer: the Autoregressive Online Bootstrap
回测与研究方法
已收录待评
2026-02-02
Sitmo
Sampling Stock Prices Directly from Option Prices
策略与交易
已收录待评
2026-02-02
Allocate Smartly
Member Note: Our Approach to Selecting Strategies for the Platform
策略与交易
已收录待评
2026-02-02
Quantpedia
Do S&P500 0DTEs Options Increase Market Volatility?
策略与交易
已收录待评
2026-02-01
Concretum Group
Seasonality in Bitcoin Intraday Trend Trading
策略与交易
已收录待评
2026-02-01
Tommi Johnsen
Target-aware Financial Sentiment: Why Structure Beats Confidence with LLMs
信号与收益预测
已收录待评
2026-02-01
Alpha Architect
Revaluation Alpha: Why Past Factor Returns May Be Misleading
回测与研究方法
已收录待评
2026-01-27
Trading the Breaking
系统平均很快,却在最需要交易时读到了旧行情
数据与信息处理
待获取全文61
2026-01-27
Quantpedia
大家都在卖的时候谁接盘?日内与隔夜的答案可能不同
策略与交易
导读完成71
2026-01-27
Relative Value Arbitrage
Modern Pairs Trading: What Still Works and Why
策略与交易
已收录待评
2026-01-25
Quantpedia
比特币最优权重为负?关键在预期收益假设,不是优化器投票看空
组合与风险
导读完成66
2026-01-25
Tommi Johnsen
AI 越一致,市场就越脆弱?这是可检验的假说,不是已证实的规律
组合与风险
导读完成55
2026-01-25
Macrosynergy
宏观如何落到个股:先学不同公司的敏感度,而不是预测整个指数
信号与收益预测
导读完成77
2026-01-25
Alpha Architect
价值投资失灵了吗?先分清估值贵、公司好与股价还能涨
信号与收益预测
导读完成63
2026-01-20
Allocate Smartly
黄金上涨还不够:为什么再看一眼美债动量?
策略与交易
导读完成81
2026-01-20
Quantitativo
组合年化从 19.1% 到 23.1%:增益来自优化,还是先找到了互补策略?
组合与风险
导读完成80
2026-01-20
Tommi Johnsen
LLM 把新闻读快了,但更快读懂不等于净收益更高
信号与收益预测
导读完成53
2026-01-20
Alpha Architect
The Many Facets of Stock Momentum
策略与交易
待修订待评
2026-01-19
Tommi Johnsen
新闻语气为负,不等于这家公司遇到了坏消息
数据与信息处理
导读完成74
2026-01-19
Quantpedia
指数头部权重很高,为什么仍不构成减仓信号?
组合与风险
导读完成69
2026-01-19
Alpha Architect
让 LLM 给动量候选股做新闻复核:有改善,但还不是稳固的 alpha 证据
信号与收益预测
导读完成81
2026-01-16
Allocate Smartly
策略该上观察名单了吗?这里的阈值是 Q1 − 1.5 × IQR
回测与研究方法
导读完成80
2026-01-16
Relative Value Arbitrage
Delta 对冲用隐波还是历史波动?先别把“已知未来波动”偷换成历史估计
策略与交易
导读完成61
2026-01-13
Trading the Breaking
Data: Building micro-machines
数据与信息处理
已收录待评
2026-01-11
Robot Wealth
策略亏了两年就该关掉吗?一个事后反弹不能给出答案
回测与研究方法
导读完成71
2026-01-11
Macrosynergy
How dollar invoicing and dollar debt shape FX risk premia
待分类
已收录待评
2026-01-09
Investment Idiocy
Are markets that are good for trend good just bc they have also gone up a lot, or bc carry, or...
策略与交易
已收录待评
2026-01-09
Klement on Investing
The fourth quarter effect in small caps
待分类
已收录待评
2026-01-06
Portfolio Optimizer
相关矩阵有空白,为什么不能直接填零?
组合与风险
导读完成83
2026-01-05
Cracking Markets
Do Breakouts of Strong Swings Work? I Tested 40 Futures Markets and the Data Is Clear
待分类
已收录待评
2026-01-04
Quantpedia
黄金与美债双动量:简单规则值得试,宏观解释还没有被证明
策略与交易
导读完成74
2026-01-04
Quantpedia
Top Ten Blog Posts on Quantpedia in 2025
待分类
已收录待评
2026-01-04
Alpha Architect
The Hidden Risks of Leveraged Single-Stock ETFs
待分类
待获取全文待评
补充 · 2026-01-12
北京大学、DeepSeek-AI
Engram:把“记住知识”和“动脑推理”分开,为什么反而更聪明?
AI / 大模型基础能力
正文核查完成87
补充 · 2026-02-15
牛津大学、UNIST、芝加哥大学、佛罗里达大学、BlackRock 等
金融 LLM 的第一道门槛:你的回测,究竟在测谁知道未来?
回测与研究方法
正文核查完成90
补充 · 2026-02-06
上海财经大学、QuantaAlpha、Stanford、北京大学等
QuantaAlpha:会进化的因子研究员,还是更有效率的历史拟合器?
信号与收益预测
正文核查完成80
补充 · 2026-03-07
Qubera AG、苏黎世大学
FinSheet-Bench:82.4% 的表格问答准确率,离放心交付还差什么?
数据与信息处理
正文核查完成83
补充 · 2026-05-05
机构信息请见原文署名;本站未逐一核验
FinSTaR:78.9% 的“金融推理准确率”,不是 78.9% 的涨跌预测胜率
信号与收益预测
正文核查完成75
补充 · 2026-08-04
ETH Zürich、Stanford 等
TimeRLM:别把十万条数据塞进提示词,让模型回到数据里找证据
数据与信息处理
正文核查完成86
补充 · 2026-09-01
Stanford University、Nanjing University、Hasso Plattner Institute
回测研究流程,而不只回测最后一条因子
回测与研究方法
正文核查完成87
补充 · 2026-09-02
Durham、MBZUAI、École Polytechnique、HBKU
同一份财报,换个角色就换了判断
数据与信息处理
正文核查完成91
补充 · 2026-09-01
哈尔滨工业大学、美的 AI 研究中心、长春理工大学等
让模型分清多层表头与数据的归属
数据与信息处理
正文核查完成81
补充 · 2026-09-04
Korea University、Hanyang University、Hyundai Motor Company
回答一个问题,如何找全分散在多篇材料里的证据
数据与信息处理
正文核查完成86
补充 · 2026-09-04
机构信息请以原文署名为准
模型升级后,旧记忆究竟丢在哪一步
AI / 大模型基础能力
正文核查完成87
补充 · 2026-08-31
Université Paris-Saclay / CentraleSupélec
个股历史长短不齐,怎样估计组合风险
组合与风险
正文核查完成86

已有解读

Quantocracy / Word 标准 · 文章解析 / 新书公告

Carver 新书把仓位、成本和交易管理放到台前;它是培训线索,不是新策略论文

Not another one! My fifth book...

Rob Carver

一句话先讲结论

Carver 介绍的新书面向不能加杠杆、不能做空的股票、ETF 和加密现货交易者,允许主观选择机会,但要求仓位、成本和风险按规则管理。对于已有系统化经验的量化研究员,新增价值更可能在培训与执行规范,而非一条可马上复现的 Alpha。这里完整解析的是作者公告,不是未读整本书的书评。

它到底在问什么?

如果交易方向来自直觉,哪些环节仍必须标准化?作者试图把寻找交易的判断与管理交易的纪律分开,尤其给没有衍生品杠杆的普通账户一套可执行约束。

作者具体怎么做?

  1. 公告称 The Art and Science of Trading 已完成校样,计划十二月一日正式出版;这是作者当时的发布说明,本次不核实购书供货。
  2. 目标场景是多头、资本约束下的股票、ETF 与加密现货,作者说它比自己此前作品更入门,使用直观解释和表格而非主要依赖公式与 Python。
  3. 内容主题包括稳健回测、分布不确定性、Kelly、成本、头寸调整与半自动交易。推荐语强调交易全生命周期,但这些属于提前读者评价,不是本次对具体章节的独立验证。
  4. 作者自己也表示,若读者已熟悉其旧作、只做杠杆期货且完全系统化,并不一定需要这本书;这为研究员判断阅读优先级提供了边界。

关键结果

原文结果与口径
核对项结果意味着什么
材料性质新书公告没有新增策略回测、显著性或可以核验的收益提升。
账户约束不加杠杆、不做空会改变风险目标可达性与工具选择,不能直接照搬期货仓位框架。
研究员用途培训与流程检查是本解析根据目标读者作出的阅读判断,不是书中经实证量化的效果。

怎么理解?

对团队而言,可以从这篇建立一张培训清单:入场观点、仓位、成本、退出、风险变化后的调整,是否各有负责人和明确规则。很多系统把大量精力投入信号,却让后面几步靠默认参数,最终收益来源便难以解释。 不过,规则化不等于正确。一个错误仓位模型也可以执行得极其一致;Kelly 对收益估计误差尤其敏感,不能仅因为书中讨论它就直接用于满额风险预算。资深研究员应把公告当成寻找清晰教学表达的线索,而不是把作者资历与推荐语替代对具体方法的审阅。

最大限制

整本书未取得和阅读,章节方法、示例表格与任何效果不能冒充已核验。本文所有内容边界以公开公告为准,也不评价未读内容是否优于作者旧作。

复现与研究价值

若用于培训,先选交易成本和风险变化后的头寸调整作为试读主题,用团队现有案例检查讲法是否能转成具体清单;再决定是否扩展。不要为了给公告补“实验结果”而编造收益表。

原文与核查

公开新书公告完整解析;未读整本书,不作为全书书评。

原始文章 ↗

作者说明:各书适合什么读者

推荐 57/100(暂定) · 问题 18/30 · 证据 17/30 · 方法 17/25 · 复现 5/15

作者清楚说明对象和边界,适合作为培训资料线索;对资深研究员的新实证信息有限。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 研究方法

夏普从 0.63 归零:先修复历史成分名单,才有资格讨论股票信号

Ghost Members. Recipe for Reconstructing Historical Membership of S&P 500 from Public Sources

Carlos García Arano

一句话先讲结论

作者为 2009—2026 年重建了 856 家发行人的标普 500 月度成分历史,成功匹配 850 家;把真实历史股票池放回原策略后,此前 0.63 的净夏普降到接近零。最重要的修正不是补几个退市价格,而是同时解决当时谁在指数里、退市公司是谁、同一个股票代码是否已经换了公司这三个问题。

它到底在问什么?

免费行情很容易下载,但今天的成分名单不能代表十年前的投资机会。研究员究竟需要怎样的身份和日期记录,才能让回测中的每一只股票确实是当时能选到的那家公司?

作者具体怎么做?

  1. 长期历史来自 fja05680/sp500 社区仓库,较近期用公开的指数增删记录独立重建,合并成 2009—2026 年月度成员表。符号附带的退市年月后缀属于信息,不能清洗时随手删掉。
  2. 显式调用包含退市公司的历史列表,再按公司名称查询 SEC。只查询存续股票会遗漏死亡样本;只按代码查 EDGAR 又可能命中后来使用相同代码的另一家公司。
  3. 存续公司通过 SEC company_tickers.json 直接解决约 87% 的匹配,其余通过公司名称找 CIK。候选 CIK 必须存在与该公司指数成员窗口重叠的 10-K、10-Q 申报,不能只凭名字相似接受。
  4. 最后保留 850 个有依据的映射,明确排除 6 个无法可靠识别的发行人,并用来源和代码不同的两套重建检查原策略是否得出相近结论。

关键结果

原文结果与口径
核对项结果意味着什么
发行人识别850 / 856约 99.3% 匹配,不代表所有成员生效日或行情都已无误。
原信号的敏感性0.63 → 约 0是更换历史股票池后的策略净夏普,不能推广为全部股票策略的偏差大小。
一处需要核查的算术856 − 667 = 189正文写两份名单相差 191 家,但其列出的总数差为 189;公开名单仍应逐项核验。

怎么理解?

这篇把数据工程变成了可证伪的研究假设。错误的代码映射比缺一行数据更危险:系统不会报错,却会给一个真实公司安上另一家公司的价格和财报。CIK 与成员窗口交叉验证的价值,是让这种看似完整的数据也必须通过经济身份检查。 独立重建使策略都失去优势,是很有力的敏感性证据,但不是名单完全正确的证明。两份来源可能共享上游错误;CIK 也通常标识申报主体,不自动解决同一发行人的多类股票。将发行人、证券、上市地点和指数席位拆开管理,才能避免把身份匹配率当成完整回测可用率。

最大限制

公开文件只有月度精度,不能直接用于日级指数纳入交易;6 个排除样本仍可能非随机。正文自身名单差额存在算术不一致,代码回收示例的具体交易所身份也应回查。本次读完文章,未独立逐行核对作者仓库或重跑前篇策略。

复现与研究价值

先为每次成员增删保存公告日、生效日、证券永久 ID、CIK 和原始证据,再抽样审核退市、并购和代码复用情形。把不同股票池的入选数量、行业敞口和策略收益逐项桥接;月频结果通过后再决定是否购买日级数据。此为未执行方案。

原文与核查

公开正文完整解析;未下载重跑作者成员文件及前篇策略。

原始文章 ↗

历史成分社区仓库

SEC 存续发行人代码映射

推荐 88/100 · 问题 29/30 · 证据 23/30 · 方法 24/25 · 复现 12/15

历史股票池是实盘前基础设施;明确的匹配规则和失败记录有复用价值,但名单算术与日级精度仍需审计。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

财报后漂移:9.6 个百分点的组间优势,调整市场敞口后只剩 0.1

Post-earnings-announcement drift decomposed by earnings predictability and gross profitability

Serhat Girgin / QuanterLab

一句话先讲结论

把 S&P 500 公司按“盈利可预测性 × 盈利能力”分成 9 组后,未对冲的 42 日 PEAD 策略里,稳定高盈利组平均年度收益 +6.6%,不稳定低盈利组 −3.0%,看起来差了 9.6 个百分点;但前者平均净多 38%,后者净空 31%。每天扣除这部分净敞口对应的指数收益后,两组变成 +2.4% 和 +2.3%,差异只剩 0.1 个百分点。

它到底在问什么?

PEAD 是否对不同公司一样强?盈利更稳定、盈利能力更强的公司,业绩超预期后是不是更容易继续漂移?这关系到在财报信号上再加质量筛选,究竟能不能增强 Alpha。

作者具体怎么做?

  1. 使用历史时点的标普 500 成分股。按过去 8 个季度盈利预测误差的稳定程度(至少 4 季度),与毛利润/总资产,各分三档,交叉形成 9 组。财务数据仅在 SEC 接受日期之后使用;这里的盈利能力不是毛利率。
  2. 信息公开的首个交易日收盘入场,盘后公告顺延;分别持有 5、10、21、42 个交易日。多空组合买显著超预期、空显著低于预期,另比较最强正向意外与全部公告都买。
  3. 2006—2025 年逐年检验。72 个研究设置加上 9 个市场敞口调整重跑,共 81 项登记研究。所有结果与排除窗口一并报告;登记指历史窗口评分前冻结规则,不是历史发生前的前瞻注册。

关键结果

原文结果与口径
核对项结果意味着什么
未对冲的组间收益差9.6 pct42 日持有期,稳定高盈利组减去不稳定低盈利组。收益为年度窗口收益平均值,不是 CAGR。
调整市场净敞口后0.1 pct按净资金敞口扣除指数收益,不是逐股 Beta 中性化。
严格筛选的组合收益差−2.0 pct/年相对不筛选,36 个设置中 30 个落后;并非每个单组都如此。

怎么理解?

最重要的拆解:看起来像“盈利质量增强 PEAD”的差异,主要被市场净敞口解释了。“多空”只表示允许做多和做空,不代表多空等额,更不代表市场中性。不同公司群体以不同频率触发正负信号,分组也顺便改变了市场方向暴露。 另一个有意思的结果:筛选最强正向意外后,投入资金的回报更高,但平均闲置资金也更多。现金不计收益,使整个组合反而落后。“更好的交易”不等于“更好的组合”;筛选的价值还取决于剩余资金如何配置,不能默认放大少量持仓就能无成本解决。

最大限制

市场调整仅在 42 日持有期执行,且不是逐股 Beta 对冲。全公告多头缺少同一组股票直接持有的基准,不能完全区分公司群体本身的收益与公告时点增量。成本未包含市场冲击;数据和平台结果未由本站独立复现。

复现与研究价值

A 股复现价值高,优先借鉴对照设计:盈利意外 × 盈利稳定性 × 盈利能力,同时做市场、行业、Size、Momentum 调整,并补上同组直接持有基准。尤其应区分业绩预告、快报和正式财报的首次信息时点,避免把已公开的盈利变化再次算作新信息。

原文与核查

已核对原文方法、表 2–6、讨论与登记说明;未独立执行作者回测。

原始文章 ↗

推荐 88/100 · 问题 29/30 · 证据 25/30 · 方法 23/25 · 复现 11/15

对照实验和结果完整报告值得借鉴;净敞口调整不等于风险中性,缺少同组直接持有基准,平台数据也尚未独立核验。分数评价阅读价值,不代表策略成功概率。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 工作论文导读

100 个 AI 投资人格年化 29.5%,却与一个普通提示的选股重合 92%

Do LLM “Crowds” Produce Investment Signals? An Empirical Test

Steven Edwards;导读 Quantpedia

一句话先讲结论

100 个 GPT-4o 投资人格各选 50 只美股,取提名最多的 50 只后,市值加权组合年化 29.5%,SPY 为 15.3%,六因子 Alpha 仍约 9.65%;但它与一个没有人格设定的普通提示组合重合 92%。最清楚的结论是角色数量没有带来多少选股多样性,而不是已经证明收益全部来自科技 Beta:原作者明确说,单一市场周期无法判定剩余 Alpha 到底来自信息、遗漏因子还是行情巧合。

它到底在问什么?

同一个大模型扮演价值、成长、逆向等不同投资者,能否像真正的智慧群体一样汇集独立信息?这里要分开两个问题:组合是否赚钱,以及一百个人格是否比一个普通提示多提供了信息。

作者具体怎么做?

  1. 作者构造 100 个不同投资哲学人格,每个要求选 50 只美国上市股票,合计出现 1,059 个不同代码;以出现频率最高的 50 个组成共识。
  2. 评估三个加权方案,公开导读重点报告市值加权结果;回测从 2024 年 1 月开始,共 561 个交易日,作者以模型标示的 2023 年 10 月知识截止时间安排检验区间。
  3. 用 Fama–French 五因子再加动量做收益归因,同时查看入选成分及普通单提示对照,检验人格的边际贡献。
  4. 对人格子集进行 bootstrap,25 个人格已能复现约 88% 的最终成分,完整组合与普通提示有 92% 重合;所有 50 只也都是标普成分,显示强烈知名公司集中。

关键结果

原文结果与口径
核对项结果意味着什么
市值加权年化收益29.5% vs SPY 15.3%回测表现不等于人格多样性的增益。
六因子年化 Alpha约 9.65%;t=3.27仍然显著,所以不能说六因子已经完全解释收益。
普通提示成分重合92%是多样性较弱的证据;不自动证明信息独立性的所有统计定义均被检验。

怎么理解?

对量化研究员,真正能带回去的是实验对照:在搭建几十个 Agent 前,先做一个不扮演角色的朴素版本,看看复杂架构究竟改变了什么。如果最终都在重复同一批大公司,增加人格很可能主要增加调用成本与看起来充分的讨论,而不是独立信号。 但这里也要比导读的强结论谨慎一步。知名科技股集中可以解释为何怀疑风格行情,尚不能证明剩余 Alpha 必然虚假。下一步应匹配行业、规模、成长、质量和实际权重,再跨不同市场环境比较;同时冻结具体模型快照和提示生成日期,知识截止标签不能单独保证完全不存在后训练信息或版本变化。

最大限制

SSRN 原文页返回 403,本次完整解析公开导读并区分其转述与作者更谨慎的结论,未核验原始全部提示、权重、股票池和代码。样本只有一个主要市场环境;成分重合率不是完整的独立信息检验,训练截止也不是无泄漏的充分证明。

复现与研究价值

将预算相同的单模型重复采样、多角色、不同模型、不同独立信息源四组放在同一个事前确定币池之外的美股候选池中,冻结提示和可见日期。先比较成分/权重/预测误差相关,再比较风格中性、净费用的样本外组合表现;不要只增加角色个数。

原文与核查

公开导读与其所引作者摘要/结论完整解析;SSRN 全文受限,未独立重跑。

原始文章 ↗

原工作论文 SSRN 6543239

推荐 85/100(暂定) · 问题 30/30 · 证据 22/30 · 方法 24/25 · 复现 9/15

多角色边际贡献的对照直接命中 AI 量化实践;单周期和原始材料未核验限制收益解释。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

PEAD 平均年收益从 −0.5% 变 +2.2%:入场日期变了,实际上连组合定义也变了

Post-earnings announcement drift 2006-2025

Serhat Girgin / QuanterLab

一句话先讲结论

同一历史标普股票池,季度初统一建仓的 PEAD 多空网格平均年收益 −0.5%;改成各公司财报已知后的首个收盘入场,平均变 +2.2%,十日持有达到 +3.1%。但这不只是把同一批交易提前:筛选从季度前五/后五变成滚动历史分位,持仓数与净多空也随消息变化。论文识别了事件时点的重要性,尚不能把全部改善都归为“更早入场”。

它到底在问什么?

大型股财报漂移究竟消失了,还是慢频组合形成时已经错过可捕捉窗口?回答前必须确保比较的事件年龄、筛选规则和风险暴露可拆开。

作者具体怎么做?

  1. SUE 为实际 EPS 减一致预期,除以公司过去八次惊喜的波动,至少四次历史才可评分;作者避免价格缩放与供应商拆股重述基准混用。
  2. 季度版本每季初取过去九十天报告,行业内买五个最大、空五个最小惊喜,固定持有后空仓到下季。
  3. 公告版本以过去 365 日行业惊喜池的 80/20 分位为阈值,正负号须与方向一致,已知公告后的首个收盘进入,所以排除隔夜跳空和首日反应;每公司只许一个未平仓。
  4. 成本按流动性分单边 1.5/3/6bp,空头年借费 50bp,记录 4,400 个计划窗口中 3,990 个执行、410 个因行业最低十五公司门槛排除。

关键结果

原文结果与口径
核对项结果意味着什么
网格均值−0.5% → +2.2% / 年配置年收益的均值,不是一个等权可投资合并组合的 CAGR。
公告后持有形状10 日 +3.1%;63 日 +0.2%平均效果随持有期衰减,与短期吸收窗口相符,但仍含暴露变化。
科技 21 日−3.0% → +10.5% / 年公告组净多倾向约 +0.23,作者也承认仍需 Beta 中性重跑。

怎么理解?

这篇胜在把形成日和事件日的区别量化,而不是泛泛说 PEAD 有或没有。一个因子按季度可算,不代表它在季度初仍有信息;事件信号的研究坐标首先应该是公开时点,而不是方便的数据频率。 但因果解释需要进一步收窄。两种版本同时改变阈值、资金使用率和净仓位,不能称为只移动一个日期的严格消融;全网格净多比例与收益低相关,也不能代替逐日 Beta 对冲。作者把既有历史按顺序冻结记录,确实约束了程序流程,却不是在 2006 年真正预注册未来测试;附录对此诚实说明,应保留。

最大限制

供应商一致预期历史、EPS 重述、事件时间戳及平台代码未独立复核;借费常数不反映稀缺,冲击成本缺失。行业分类变化令部分行业样本较短。所谓 90% deflated-Sharpe 数字也不是策略真实有效的客观后验概率。

复现与研究价值

做四格实验:固定同一筛选只改日期、固定日期只改筛选,再对照资金利用率和 Beta 中性版本。特别核查科技的 +10.5% 在逐日敞口扣除后剩多少;真正价值在于事件时间对齐,而非直接采用最好行业格。

原文与核查

公开研究全文、所有主要表及附录说明已读;未独立运行平台。

原始文章 ↗

推荐 88/100 · 问题 29/30 · 证据 25/30 · 方法 24/25 · 复现 10/15

完整网格和事件方法信息量高,主动披露排除及偏多;关键输入和分离效应仍需独立复核。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 工程实践

AI 研究系统的核心不是多跑回测,而是阻止错误结果进入决策

The Quantish Research Harness

Quantish

一句话先讲结论

一个加密策略原本报告累计收益 +139%,订单对账才发现保证金设置让 63% 的计划入场没有执行;修正后基准收益降到 +81.6%,回撤反而加深。Quantish 因此把 AI 研究助手放进预注册、代码审核、订单核对和样本外检验的固定流程:文章真正有价值的不是声称 AI 找到两条策略,而是展示哪些检查曾把漂亮结论推翻。

它到底在问什么?

当 AI 可以快速改代码、跑参数、写解释,研究团队如何阻止它把实现错误、单月好运和反复试验包装成稳定策略?

作者具体怎么做?

  1. 看到结果前先把假设、数值接受标准和停止条件提交 Git;新功能默认关闭,关闭时要求原基准保持不变,避免实验污染已经接受的版本。
  2. 影响判决的脚本必须以哈希通过独立对抗审核,才允许运行。回测后先检查新代码是否真正触发、计划订单是否对应成交或明确拒单,再讨论收益。
  3. 参数扫描寻找附近设置共同有效的区域,而不只报最优点。只有预先选定的候选进入隔离样本外,按费用、滑点和借券成本计算,并报告相对基准差值的置信区间。
  4. 将失败试验也保留永久记录与证据包;一个 41 次调参研究的全部样本内赢家在样本外反转,于是保留旧基准,而不是继续扫描直到出现想要的答案。

关键结果

原文结果与口径
核对项结果意味着什么
执行错误修复+139% → +81.6%作者两次基准累计收益,文章未给出足以重建完整年化口径的流水。
订单覆盖缺口63%计划入场未执行比例;被过滤的交易恰好美化了旧回测。
参数优化失败41 次试验作者称全部样本内赢家样本外反转,说明系统保留负结果,而非证明检验绝不会失效。

怎么理解?

最值得移植的是“先验证试验确实发生”。编译通过、云任务成功、出现净值图,只能证明程序跑完;如果仓位、拒单或新分支触发率错误,后面的 t 值再严谨也只是分析错误对象。订单不变量通常比再加一个高级统计检验更早救命。 不过,哈希审阅与预注册不是自动免疫系统。审核者可能共享同一错误,研究员也可能不断启动新的预注册项目来消费同一份样本外。真正需要持久记录的是整个研究族的尝试次数、数据接触历史和失败原因,而不只是单个获胜项目的完整日志。

最大限制

文章是系统作者自述,没有公开完整代码、两条策略交易流水或独立复核,因此不能据此认定其策略可部署或收益可信。bootstrap 如何处理时间依赖、整个研究族如何校正多重检验,也未充分展开。

复现与研究价值

可先落地最小版本:策略规格锁定、默认关闭实验开关、目标仓位—订单—成交三段对账、参数试验账本和一次性留出集。让助手生成结论前强制输出未成交比例、收益贡献最集中的月份与净成本差,再由人决定是否推进;不必照搬完整平台。

原文与核查

公开工程文章全文已读;未获得作者完整系统与交易记录。

原始文章 ↗

推荐 83/100 · 问题 29/30 · 证据 20/30 · 方法 24/25 · 复现 10/15

研究治理和订单对账高度实用;案例缺乏独立流水验证,不能当作业绩证据。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

十币周频动量只有 0.37 夏普;但这次“复现失败”本身也有成本和口径问题

I built paper-spec crypto strategy on 5.8 years of data. It's lost money every year since 2024

Patrick Mortenson

一句话先讲结论

作者用 10 个主流币,每周买过去一周最强的 3 个、卖最弱的 3 个,2020 年末至 2026 年 9 月的 303 次调仓只得到 0.37 年化夏普、41.7% 最大回撤;2025 年亏 24.0%,2026 年前 34 周亏 11.1%。但标题说“2024 年以来每年亏损”,正文 2024 年却是 +0.4%,成本计算也疑似未按组合权重汇总:这是一份值得追查的失败报告,尚不足以宣判加密截面动量已失效。

它到底在问什么?

文献中的短期加密动量优势,在较新的大币种样本里能否直接复制,而不靠调参数挽救?

作者具体怎么做?

  1. 币池是 BTC、ETH、SOL、XRP、DOGE、BNB、ADA、AVAX、LINK、LTC,行情采用 Binance 现货日收盘,区间 2020-10-31 至 2026-09-02。每七天排序一次。
  2. 买前三、卖后三,每腿占组合六分之一,中间四个不持有;持有一周后更新。文章假设每次全部换手,单边成本 0.15%,同时用永续合约执行费率描述成本,却没有加入资金费。
  3. 先汇总 303 个周收益,再逐年拆分:2020 年仅八周收益很高,2021 接近平,2022—2023 较好,2025—2026 明显亏损。
  4. 作者把较差结果解释为可能的套利竞争、机构化或币池过窄,但没有分别检验这些机制,也选择不继续扫描参数。

关键结果

原文结果与口径
核对项结果意味着什么
全样本风险收益Sharpe 0.37 / MDD 41.7%作者报告的扣费结果,成本代码尚未核验,不能直接作为同类策略可靠基准。
近期收益2025 −24.0%;2026 −11.1%2026 仅前 34 周;不能把“86 周合计负收益”说成连续 86 周每周亏损。
标题与表格冲突2024 +0.4%正文并非 2024 年起每年负收益,需保留这一重要反例。

怎么理解?

逐年拆解比一个总夏普更有价值:较早的八周暴涨可能长期支撑总样本均值,而对当前部署者帮助不大。不过,低胜率本身不证明套利耗尽;动量可以依赖少数大赢家,必须同时看盈亏比、收益尾部和每年风险暴露。 更重要的是执行口径。文章称六腿完全轮换导致每周约 1.8% 组合成本;按其每腿六分之一、来回 0.30% 的文字定义,总资产口径应先权重加总,不能直接六倍。另一个问题是用现货价格模拟空头永续,而默认资金费多空抵消;不同币种资金费并不相同。这些问题未修复,失败可能同时含有信号衰减和记账偏差。

最大限制

十个现存大币的回看选择有幸存者偏差;没有逐笔代码、永续收益及资金费核验;文章所谓真实夏普大于零的 81% 概率未说明统计假设。终值 1.47 的“约 6.8% 年化”也只是作者近似报告。

复现与研究价值

先核查六腿加权成本、持仓延续时的真实换手、可做空日期和资金费,再用当时可交易币池重做原规格。冻结规则后分别报告 2020—2023 与 2024 以后净收益;比较基准差异时,不把增加币种或重扫窗口当成无代价修复。以上未执行。

原文与核查

公开正文全文已读并检查内部数字一致性;未取得作者本地回测 JSON。

原始文章 ↗

推荐 69/100(暂定) · 问题 25/30 · 证据 15/30 · 方法 19/25 · 复现 10/15

负结果与年度拆分有价值,但成本权重、标题及现货/永续口径存在实质疑点。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 产品公告

EigenScore 是量化编程练习场,不是用 Elo 证明投资能力的研究论文

EigenScore is Live: The First Rated Contest Platform for Quants

Vertox

一句话先讲结论

EigenScore 首发提供 50 道量化题,分精确答案、预测和决策优化三类,并计划用两小时五道题的竞赛累积 Elo 评分。它适合检验概率、数值和建模基本功;公告没有证明高排名能预测真实交易绩效,也没有公布判题器独立验证,所以不能把“量化竞赛评分”当成研究员的 Alpha 分数。

它到底在问什么?

量化能力很难只靠简历和自述判断,能否建立有固定问题、隐藏测试和持续评分的公开练习环境?这是训练与评估工具问题,不是市场定价问题。

作者具体怎么做?

  1. 作者称首发题库有 50 道原创题,覆盖概率、组合数学、鞅、随机微积分、期权定价、组合优化、时间序列与数值方法。用户在浏览器提交 Python。
  2. 标准题利用容差检查数值答案,预测与优化题使用不同的相对基准。若要比较能力,需要进一步知道各题基准、隐藏测试分布和不同题型分数如何合成。
  3. 公告介绍限时、限内存的隔离虚拟机运行,每次提交后销毁环境;另有两小时、五题的同时竞赛及持续更新的 Elo 等级。
  4. 所有题目、参考解和测试由作者制作;首发公告征求错误判决和不清楚题意的反馈,意味着题库和评分机制仍处于早期迭代。

关键结果

原文结果与口径
核对项结果意味着什么
首发规模50 道题作者公布的上线题库数量,不是独立试用核验后的持续库存。
竞赛设置2 小时 / 5 题评测时长和题数,不是研究项目的工作量标准。
投资有效性未报告没有高 Elo 与真实样本外 Alpha 的验证,不能据此筛选可投资策略。

怎么理解?

对研究团队,最合适的用法是把题型映射到具体短板:概率推导、估计误差、数值稳定性、约束优化。比起只看总分,复盘同一道题为何失败,往往更能指导培训。短时竞赛尤其擅长测熟练度,却未必能测数据取证、金融制度理解和长期研究纪律。 评分质量也有自己的模型风险。参考答案错、容差过窄、训练分布与隐藏测试不一致,都会让排名反映判题机制而不是能力。对于预测和决策题,还应检查是否存在可利用的固定随机种子、重复提交反馈和基准信息泄漏。公告尚未给出这类验证。

最大限制

这是一篇产品上线公告,不是实证论文;本次未注册、提交代码或审计虚拟机安全。正文称 9 月 8 日为周一,与 2026 年日历不符,不能将该句作为可靠的活动时间提醒。

复现与研究价值

若用于团队培训,可先选少量已知答案的题检查容差和重复性,再按知识模块记录错误而不直接按总 Elo 排人员。招聘时仍需另测真实数据清洗、研究审计和解释能力;不要让游戏化分数替代工作样本。

原文与核查

公开上线公告完整阅读;未实际使用或安全审计平台。

原始文章 ↗

EigenScore 平台

推荐 54/100(暂定) · 问题 16/30 · 证据 14/30 · 方法 16/25 · 复现 8/15

量化训练入口有一定价值,但目前只有产品自述,没有题库或投资相关性的独立验证。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

隔夜轮动号称每年翻倍;90 日选股并不自动消除筛选偏差和开收盘成交风险

2x Your Portfolio Every Year: How I Turbocharged the Overnight Effect

Stuart Farmer

一句话先讲结论

作者先按 2020—2025 年隔夜表现挑出十只股票,得到未扣费的 727.6% 年化,再改用过去 90 个交易日排名、每 7 日更新持仓,并假设每次买卖各 5bp,宣称仍接近每年翻倍。但他明确说这些参数是“找到最好”的设置,滚动计算并不等于未调参的样本外;极高收益首先要求核查价格复权、股票池和开收盘可成交量,而不是相信标题。

它到底在问什么?

股票收盘到次日开盘的收益差异,能否通过动态选股持续捕捉?核心不是市场整体存在隔夜溢价,而是过去最会隔夜上涨的股票是否还能在下一段时间继续如此。

作者具体怎么做?

  1. 第一步在 2020—2025 年选择隔夜总收益最高的十只完整存续股票,另列上市或退市导致历史不完整的股票组,展示未扣费结果。
  2. 将收益的自然对数取四次方作为分数,按分数分配权重,删除低于 1% 的权重后再归一化。四次方的选择来自作者偏好的尖锐程度,不是预先证明的最优经济形式。
  3. 滚动版本每七日使用此前 90 个交易日重新选择股票,设置市值下限十亿美元;持仓仍每天收盘买、次日开盘卖,因此选股七日更新不代表每七日才交易。
  4. 模拟单边 5bp、来回 10bp 摩擦。行情依赖 Massive 数据,完整策略和 notebook 位于付费订阅区,公开另有数据下载工具。

关键结果

原文结果与口径
核对项结果意味着什么
事后十股初筛727.6% CAGR未扣费、经过选优的历史结果,不能解释为可执行预期收益。
滚动设置90 日形成 / 7 日更新内部信号向前滚动不排除研究者在全历史上选择这组参数。
执行假设5bp / 单边每天隔夜交易的成本假设;不覆盖所有容量、冲击和开盘异常情形。

怎么理解?

文章最有研究价值的方向是检验隔夜收益的截面持续性;最危险的跳跃,则是从指数隔夜溢价直接跳到数倍年化。极端赢家可能集中在低价格、复权事件和开盘跳变较多的证券,少数错误数据就会被四次方加权进一步放大。 真实下单还存在时点约束:若用当日最终收盘价确定名单,又假定同一个收盘价成交,收盘竞价订单截止时间可能不允许这一过程。开盘价也不是无限容量的报价。先证明信号形成时已经可知、目标股当时满足市值过滤,再讨论手续费能否低到 5bp,顺序不能反过来。

最大限制

公开正文足以解释规则,但完整代码和明细图表未核验;未见完全冻结规格后的独立持出期、点时股票池、实际开收盘订单与容量检验。作者对做市商行为的机制猜测不是本文已识别的因果证据。

复现与研究价值

用未复权成交价建立现金流,再独立处理拆股和分红;剔除明显坏价,并按开收盘成交额限制参与率。冻结 90/7 与加权规则,保留真正未接触时段,同时对收盘提前形成信号、次日执行和 10—30bp 摩擦做压力测试。以上尚未执行。

原文与核查

公开正文完整解析;付费代码及图表详细绩效未核验。

原始文章 ↗

公开行情处理工具 massivepull

文章引用的隔夜机制工作论文

推荐 64/100(暂定) · 问题 24/30 · 证据 15/30 · 方法 17/25 · 复现 8/15

规则具体、问题值得查,但极端收益与多层选优、复权及竞价时点风险要求先审计再研究。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

纯噪声也能被 AI 做出 2.12 夏普:不仅要记录试了多少,还要记录拼了多少

A Sharpe of 2.1 From Nothing: The Second Number Your Agent Doesn't Log

Jonathan Kinlay

一句话先讲结论

在按构造没有收益可预测性的 12 组模拟数据上,研究 Agent 做出的组合样本内夏普平均 2.12,样本外只有 0.18、且误差很大;单靠试验次数能解释约 54% 的样本内分数,再把最终拼入多少个子信号算进去,就能解释约 88%。因此日志只记跑了几次回测还不够:把一堆幸运赢家组合起来,也会制造漂亮但不真实的分散收益。

它到底在问什么?

AI 提高研究速度后,到底更容易发现真实规律,还是更有效率地把噪声选成 Alpha?如果所有调用都可记录,能否据日志测量这台研究机器的过拟合能力?

作者具体怎么做?

  1. Agent 每轮最多提交 25 个表达式、最多 12 轮,只看到匿名样本内评分,测试集文件物理隔离;每轮假设和调用记录保存,策略按一天滞后构建资金中性排序组合。
  2. 每次最终报告三条信号,但 Agent 的信号内部可以是多个表达式相加。模拟实验中,中位试验数为 146,最终组合实际上约有 12.5 条相加子腿,而机械搜索通常只有 3 条。
  3. 在没有 Agent 的零 Alpha 数据上,单独模拟从 N 条随机表达式取最好的 k 条再平均,得到选择加组合的基准曲面;按 Agent 实际 N 和 k 预测夏普 1.86,对照实际 2.12。
  4. 再以 1,280 只 NASDAQ 股票、2018—2023 数据作现实检查:Agent 训练夏普 3.10,留出为 0.72,但不同搜索组样本外差异落在较宽置信区间内,不能据此认定 Agent 更差。

关键结果

原文结果与口径
核对项结果意味着什么
零 Alpha 模拟IS 2.12 / OOS 0.18样本外标准误 0.44,与真实零一致;不是可交易模型业绩。
选择加组合解释1.86 / 2.12 ≈ 88%是此实验的校准解释量,不是所有 Agent 业绩统一扣减比例。
真实面板3.10 → 0.72有幸存者与单一持出路径限制,不能用简单差值识别全部过拟合。

怎么理解?

最重要的贡献是把“研究自由度”从单个候选数扩展到组合结构。均值选高以后,再靠部分低相关腿降低波动,会把同一份样本内好运包装成风险分散。纠正时必须让随机基准拥有与真实搜索相同的表达式语法、加总能力和组合选择过程。 作者也做了很好的自我否定:用模拟过拟合夏普直接从真实训练夏普扣掉,碰巧对 Agent 接近,却在其他组明显失准,因此它不能预测未来业绩。另一个泄漏筛查因为构造方式注定难以触发,作者明确承认无效。这些负结果比一个漂亮的“AI 风险折扣公式”更可信。

最大限制

只有单循环研究助手和少量独立面板;模型中途切换,具体快照日志不完整;真实股票集带幸存者条件,测试期可能在模型训练语料内。本文未独立运行仓库;模拟零 Alpha 依赖生成器确实没有未预期预测结构。

复现与研究价值

给研究日志增加最终表达式树、实际子腿数、被拒试验与模型版本,并在进入真实数据前先让完整流程跑零 Alpha 面板。将整套选择和组合机制一起校准;不把 2.12 当统一扣减,也不让研究助手用经济故事替代独立验证。

原文与核查

作者公开全文及限制完整解析;未独立执行仓库。

原始文章 ↗

作者代码与预注册日志

推荐 93/100 · 问题 30/30 · 证据 26/30 · 方法 25/25 · 复现 12/15

问题、对照、失败预注册与机制拆解完整,直接适合 AI 研究治理;仍需独立运行和更多模型重复。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 论文导读

股债相关从正转负确实改变风险,但“负相关拖累收益”是需要纠正的叙述

Stock-Bond Correlation: The Sign Flips and So Do Its Drivers

Ali H. Askar;原研究 David G. McMillan

一句话先讲结论

导读报告美国股债相关在 2000 年前后由 +0.22 变成 −0.24,50/50 组合月波动由 2.72% 降至 2.42%,月均收益也由 0.52% 降至 0.29%。两件事同时发生,不等于负相关导致收益下降:相关系数直接进入组合方差,不直接决定固定权重的算术平均收益。文章把“需要更多股票追上旧收益趋势”说成负相关的代价,这一步超出了证据。

它到底在问什么?

股债能否互相对冲不是永恒属性;随着通胀、利率和经济冲击变化,相关结构会不会长期换挡,风险预算该如何跟着变化?

作者具体怎么做?

  1. 按各国可用数据考察 1980—2023 年 G7 市场,比较长期相关和动态相关。多数市场在约 2000 年转负,日本更早,意大利仍大体为正,不能把美国经验当成统一世界规律。
  2. 用滞后通胀、产出、二者波动、实际利率及通胀—产出相关解释股债相关,并用结构断点模型允许系数跨时期改变。
  3. 导读称实际利率是较稳定的相关解释变量,通胀和增长的方向及显著性更依赖时期;这是约化回归相关,不等于已识别哪一种宏观冲击造成变化。
  4. 最后比较 50/50 组合的收益、波动与协方差贡献。匹配同一全样本波动目标所需美国股票权重由早段 41% 变为后段 54%,不能与另一幅追踪收益趋势的 80% 权重混为同一目标。

关键结果

原文结果与口径
核对项结果意味着什么
美国股债相关+0.22 → −0.24两个历史阶段的估计,不是未来固定参数。
50/50 月波动2.72% → 2.42%风险降低与相关下降一致,但同时期单资产波动也在变化。
匹配同一波动的股票权重41% → 54%和文中 80% 的收益趋势拟合不是一回事。

怎么理解?

这篇最值得保留的是“驱动因素自己也会变化”。把长期负相关写进协方差矩阵,然后机械增加股票风险,容易在通胀冲击重新占主导时暴露系统性弱点。风险测试至少应包含股债一起下跌的状态,而不是只看平均相关。 同时必须修正文中的因果捷径。对固定权重组合,算术期望收益由各资产期望收益加权决定;相关下降通常带来方差下降,并非自动拖累收益。后段平均收益较低可以来自股票、债券的收益环境变化。拿旧趋势线要求新组合追上,是另一种目标设定,不能由此声称负相关失去了分散好处。

最大限制

已读完整导读,原论文完整估计未独立复算;动态相关本身是估计量,宏观回归又有结构断点与修订数据问题。文中多个组合目标和因果表述容易混淆,本解析不沿用其“负相关减少分散收益”的说法。

复现与研究价值

将预期收益、单资产波动和相关三个输入分别改变,做风险预算敏感性表;用只含当时可见数据的滚动估计检验是否改善目标波动控制。不要用全样本断点事后识别的状态直接指导历史仓位。

原文与核查

公开导读全文解析;原论文表格与估计未独立复算。

原始文章 ↗

推荐 74/100(暂定) · 问题 25/30 · 证据 20/30 · 方法 21/25 · 复现 8/15

跨国相关与结构变化值得读,但导读对相关和平均收益的混合解释需纠正。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 研究方法

总结果过关,年份与排名却露馅:别让自动判决替你停止思考

Backtest Said "SURVIVES." Per-Year Numbers Said No. I Learned to Trust the Second One

Jan Heger

一句话先讲结论

一个价格形态的完成率为 30%,高于随机对照的 19%—20%,自动脚本判定有效;但七年中有三年贡献为零。另一个价位筛选在样本内外都找到赢家,赢家排名的跨期相关却是 −0.54。问题不是总数算错,而是把集中发生的现象和每期重新挑出的赢家,误认成了可以向前执行的稳定规律。

它到底在问什么?

自动研究系统能否用一个 SURVIVES 标签概括策略有效性?如果算法只看平均优势,就可能漏掉时间集中和选股规则在样本外悄悄改变的问题。

作者具体怎么做?

  1. 作者先检验 zone-cycle 价格往返模式,真实样本完成率约 30%,控制组约 19%—20%,聚合判决通过。
  2. 将结果拆成七年,贡献依次为 91、0、63、0、0、34、13。正文未说明这些贡献值的货币或频数单位,因此只能按作者的贡献序列理解,不能当成年收益率。
  3. 另一项实验比较不同价位组,脚本声称样本内外最好组都优于其他组;作者进一步计算两个时期价位表现排名的相关性,得到 −0.54。
  4. 作者据此增加年度贡献和排名稳定性关卡,让它们有权推翻聚合判决,而不是只放到附录。

关键结果

原文结果与口径
核对项结果意味着什么
聚合形态完成率30% vs 19%—20%是形态完成率,不是交易胜率或策略净收益。
跨期排名相关−0.54同一价位的相对优劣在两个时期反转,不支持固定优选名单。
年度贡献7 年中 3 年为 0存在时间集中;未给出单位、每年机会数,不能直接判定统计上失效。

怎么理解?

第二个错误比第一个更明确:若样本外又重新找赢家,那么所谓样本外测试其实仍在使用答案。正确问题是,用样本内锁定的价位和规则,在下一段数据上是否仍有优势;排名相关可以揭穿这种看似严谨的比较。 但“必须多数年份赚钱”不能成为所有策略的普遍公理。尾部对冲和危机趋势可能本来就靠少数年份兑现;某年没有交易机会也不同于有大量机会但收益为零。时间拆解应结合事先提出的经济机制、暴露和机会数,而不是再制造一个偏好平滑曲线的新筛选器。

最大限制

文章未公开样本资产、时间区间、控制组构造和检验显著性,也没有完整交易规则。七年贡献的单位未说明,因此本篇可作为审计案例,不能据其数字复现一个可交易策略。

复现与研究价值

对现有研究报告同时输出按年机会数、风险投入、收益贡献和冻结名单的下一期表现;再做留一年剔除检验,观察结论是否由单一年份决定。任何新的稳定性阈值也应在下一轮测试前锁定,不要看完结果再调整门槛。

原文与核查

公开正文完整解析;无法据正文重建原始两项实验。

原始文章 ↗

推荐 74/100 · 问题 26/30 · 证据 17/30 · 方法 22/25 · 复现 9/15

跨期重新选优是常见隐性泄漏;案例细节不足,年度一致性规则也需按策略机制使用。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 论文导读

比特币高波动会延续,但 96% 的状态留存里藏着滚动窗口重叠

Volatility Clustering in Bitcoin: Regime Persistence as a Forecast

Ali H. Askar;原研究 Borrego Roldán

一句话先讲结论

导读将比特币滚动波动率分成低、中、高三档:一小时数据、24 期窗口下,高波动下一小时仍为高波动的概率为 96.29%,随后 48 小时平均绝对涨跌为 4.42%,低波动时为 2.39%。但分档阈值用全样本算出,且相邻波动窗口共享 23 个小时数据;这些结果说明状态有持续性,却不能直接证明一套已可实盘的预测模型。

它到底在问什么?

现在波动很高,能否据此预测未来价格变动的幅度,从而调整风险?注意这是幅度问题,不是预测比特币下一步上涨还是下跌。

作者具体怎么做?

  1. 原研究以 2018 年 8 月至 2024 年 11 月比特币数据计算滚动收益标准差,再取对数,考察一小时到日线等不同频率和窗口。
  2. 用全历史的 20/80 分位阈值把当前滚动波动分类,数相邻观测的转移次数得到三乘三矩阵。24 小时窗口的低、中、高留存率分别为 95.05%、97.15%、96.29%。
  3. 比较状态之后的绝对价格变化:小时模型考察 48 小时,日线模型主要考察七日;高低组在均值和离散程度上都不同。
  4. 导读明确指出全样本阈值使用了未来资料,滚动阈值修复在原研究中仅为建议,并未实现;因此公开矩阵属于回看估计。

关键结果

原文结果与口径
核对项结果意味着什么
高波动下一期留存96.29%一小时一步,不是明天仍处于高波动的概率;导读的一处 tomorrow 表述不准确。
未来 48 小时平均绝对变化高 4.42% / 低 2.39%无方向的幅度均值,不是可赚取的交易收益。
高组均值加标准差8.79%不是经校准的 VaR、置信上界或保证覆盖区间。

怎么理解?

最容易被忽视的是机械平滑。24 小时标准差下一小时只换掉一个观测,即使原始收益独立,波动估计也会高度相关。长窗口比短窗口更持久,并不能单独证明市场记忆更强。应让同样滚动窗口作用于适当的模拟对照,再测新增的真实聚集。 风险应用仍然合理:当前高波动通常值得降低名义仓位,但模型价值要体现在未来风险校准,而不是状态分类准确率。若一个模型永远预测下一小时状态不变就已经很准,复杂转移矩阵需要证明比这个廉价基准更好。文章用全样本阈值的问题也不能被“波动聚集是常识”抵消。

最大限制

本次读完导读,未取得原研究代码并重算;重叠预测区间使极大 t 值的独立样本解释存疑。导读声称两小时和两百小时持续都“同样一致”也过于宽泛:几何模型允许两者,但概率并不相等。

复现与研究价值

用仅截至当时的数据更新分位阈值和转移矩阵,对比恒定状态、EWMA 和简单 HAR 类预测;采用不重叠检验段或保留依赖的重抽样。报告未来绝对收益预测误差、风险区间覆盖率和风险目标偏离,不把预测幅度直接变成买卖方向。

原文与核查

公开导读全文解析;原研究数据与代码未独立核验。

原始文章 ↗

推荐 75/100 · 问题 24/30 · 证据 20/30 · 方法 21/25 · 复现 10/15

适合设计风险状态基线,但未来阈值和机械重叠必须先修复,才谈实盘增益。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

月度 TAA 改成每日全仓调仓:毛收益没改善,额外成本却超过每年 2%

Does Trading TAA Strategies More Often Improve Performance?

Allocate Smartly

一句话先讲结论

从 90 条月度 TAA 中随机抽 5 条组成等权组合,重复 1,000 次后,作者发现把全组合从月末调仓改成半月、每周或每天,并未改善毛表现;每天调仓的额外摩擦拖累超过每年 2%。这并不否定分批执行:把资金拆成每月各调一次的子组合,与整笔资金反复交易,是两种完全不同的换手结构。

它到底在问什么?

更快响应信号是否能让慢频策略更好地避险?还是月度信号里的日常变化主要制造反复进出,从而多付成本却没有增加预测信息?

作者具体怎么做?

  1. 在所跟踪的 90 条月度策略里随机选择五条,每条权重 20%,构建 1,000 个组合;因此检验对象是策略组合而不是某一条最佳模型。
  2. 对每个组合分别模拟月末、半月、每周和每日交易。每次按当天重新计算信号,不只是延迟执行月末旧信号。
  3. 先不加摩擦看毛效果,再按单边 0.1%、来回 0.2% 加入交易摩擦。作者称更高频率在毛表现和最大回撤上也没有带来改善。
  4. 周频采用归一化交易日 5、10、15、21,半月为 10、21,日频并非所有自然交易日都必然纳入;这属于平台近似日历,不应称为精确每周同一星期交易。

关键结果

原文结果与口径
核对项结果意味着什么
测试覆盖1,000 个组合 × 4 频率随机组合共享大量底层策略,并非 4,000 个独立统计样本。
单边摩擦0.1%费用与滑点的统一假设,不代表所有 ETF 的实际成交成本。
每日执行额外拖累>2% / 年正文给出的摩擦影响量级;图表详细指标未在本次文本中逐格核验。

怎么理解?

最值得理解的是研究对象变了。月度信号的窗口长度没变,但每天按微小排名变化重新下单,会不断交易临界点噪声;如果毛收益本来就没有增加,降低佣金只能少输一点,不能替它创造优势。 同时,月末相对其他日期的历史优势可能贡献了部分差距。分批执行是在接受一定历史收益损失的同时分散单一日期风险;高频全仓执行则额外增加大量换手。两者的收益与风险交换条件不同,不能用同一句“交易更频繁”描述。

最大限制

公开正文的细表以图片呈现,本次没有逐格读取;回测完整区间与随机组合依赖结构未在正文充分交代。90 条平台存量策略本身可能经过历史筛选,结论不等于所有月频策略都无法改为快频。

复现与研究价值

对自己的模型固定信号与样本,分别测试月末、错日分批和全仓快频,并报告排名变动引起的无效换手、信号延迟、成交成本与危机期表现。加入小额不交易区间后再比较,而不是只通过缩短调仓间隔来宣称提高反应速度。

原文与核查

公开正文、计算说明完整解析;图片细表未逐项核验。

原始文章 ↗

推荐 81/100 · 问题 26/30 · 证据 23/30 · 方法 23/25 · 复现 9/15

对执行频率与分批的区分清楚,组合层证据有用;平台样本和图表明细仍需进一步审计。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 论文导读

Boundary 不是“贵了就卖”:它判断的是趋势在估值极端处是否更容易反转

Boundaries of Time Series Momentum

Matti Suominen / Erik Hjalmarsson;导读 Quantpedia

一句话先讲结论

这篇不是给 CAPE 设一个贵便宜阈值,而是把股票估值和期限利差相对历史区间的位置合成 Boundary,检验过去涨跌的方向在极端状态下是否反转。论文报告加入边界相关变量后,动量收益预测回归的 R² 最多相对提高 550%;这是解释力相对增幅,不是策略收益增加 550%,更不是已经验证了“Boundary 超过 1 就反向交易”的统一交易规则。

它到底在问什么?

同样是过去一年上涨,为什么有时代表趋势延续,有时却接近反转?作者想用股票和债券的估值状态解释动量为何不是在所有市场环境里都同样有效。

作者具体怎么做?

  1. 原论文使用美国及 20 国数据,以 CAPE 或股息率代表股票估值、长短国债收益率差代表债券估值状态;考察的是未来十二个月的市场及动量收益。
  2. 先平滑估值,再按历史区间缩放到 −1 至 +1,Boundary 是股票估值位置平方加期限利差位置平方。因此高估与低估都可能处于边缘,它不是单向的昂贵程度指标。
  3. 原文历史归一化使用十年或二十年窗口,本文说明这一原始设计,不要求中国短样本必须照搬。改成 24 或 36 个月属于新的适配假设,需要单独检验,而非论文推荐值。
  4. 检验的关键是边界与过去市场收益的交互:边界越极端,原来趋势方向是否越容易逆转。统计关系通过回归建立,不应直接跳过仓位映射和执行成本变成硬反转策略。

关键结果

原文结果与口径
核对项结果意味着什么
导读报告的相对解释力增幅最多 +550%R² 的相对变化,不是收益、胜率或年化 Alpha。
指标结构两个标准化位置的平方和方向对称:高端和低端都可能是边界,不能只理解为估值昂贵。
交易阈值没有本文可据此确认的统一 1 阈值连续预测关系转成开关,需要另定规则并验证,不能把自设阈值冒充论文定论。

怎么理解?

经济上最有意思的不是价值因子和动量因子简单相加,而是价值状态可能改变动量的含义。若价格上升同时把估值、利率和政策反应推到极端,再继续追涨的风险便不同于正常扩张时期。这是一条条件机制解释;并不意味着任何昂贵市场马上下跌。 对现有研究,首先应该问“这个边界是否真的改变动量的条件收益”,然后才问“用什么仓位交易”。连续缩放、只降风险和硬反转承担的假设依次增强:硬反转不但相信趋势失效,还相信反向收益足够覆盖成本。短样本极值容易由一个异常点决定,24 与 36 个月之间结果差异若很大,应看作估计不稳定,而不是挑较好的一个。

最大限制

已读导读并核查原论文关键定义与回归,未逐表复算原数据。长周期重叠收益、持久估值变量和窗口选择使统计推断复杂;不同规格样本长度也可能变化,不能只看最大 R² 增幅。宏观指数结论直接外推个股,仍缺少独立证据。

复现与研究价值

先固定当前可用样本内的少数窗口,不用全历史搜索最优值;对个股保留同一个市场级状态作为条件变量,检验组内动量收益,再比较连续减仓与硬反向。报告触发次数、各次事件贡献及扣费结果,特别标出是否由一轮行情驱动。这里只提出方案,不引用此前未在本次核验的本地回测数值。

原文与核查

Quantpedia 正文完整解析;Wiley 原论文关键定义、回归和稳健性段落核查,未独立复算。

原始文章 ↗

正式论文全文:Boundaries of Time-Series Momentum

工作论文 SSRN 6867878

推荐 88/100 · 问题 29/30 · 证据 25/30 · 方法 24/25 · 复现 10/15

把估值状态与动量方向联系起来,研究问题强且有正式论文;落地阈值和短样本个股适配仍需另证。

返回全年目录 ↑

Quantocracy / 导读完成

Sharpe 相同,不代表每一段时间都赚得一样稳

The Sharpe Stability Ratio: Evaluating the Sharpe Ratio Temporal Consistency

Portfolio Optimizer;介绍 Bajo Traver 与 Rodriguez Dominguez 的 SSR

评价策略不能只问全样本赚了多少,还要问收益是否集中在少数阶段。稳定性指标是补充,不是自动选出更好组合的开关。

2 分钟看懂

一个策略平时不赚钱、只在危机时大赚,另一个慢慢赚钱,全样本 Sharpe 相同,你需要的是哪一个?

把整段收益压成一个 Sharpe,会丢失收益发生的时间结构。把滚动 Sharpe 画出来又不等于解决统计推断。

编辑自设例子,非作者实验

自设例子:策略甲每次市场危机都能保护组合,乙在平稳期持续贡献。若只奖励稳定赚钱,可能误删甲;若只奖励平均 Sharpe,又可能误把偶然的一次暴赚当稳定能力。指标要服从组合角色。

  1. 计算同口径的滚动 Sharpe
  2. 比较平均水平与预设基准
  3. 修正重叠窗口的自相关
  4. 结合策略角色解释稳定性
关键结果与解释边界
核对项结果意味着什么
最大 SSR 组合8.44% / 29%文章示例的年化收益 / 最大回撤,不是样本外承诺。
最大 Sharpe 组合5.90% / 18%同一示例的对照;较低收益伴随较浅回撤。
滚动窗口没有通用最优值是平滑程度的选择,不是必须用某个超长年限。

不能推出什么

更高 SSR 不等于更低回撤;示例配置不能直接当投资建议。窗口、基准和估计方法都要预先固定。

研究用途

研究报告并列展示全样本、分阶段和回撤,而不是再加一个可以事后挑高的指标。

详细讲解

编辑理解

一个策略平时不赚钱、只在危机时大赚,另一个慢慢赚钱,全样本 Sharpe 相同,你需要的是哪一个?

把整段收益压成一个 Sharpe,会丢失收益发生的时间结构。把滚动 Sharpe 画出来又不等于解决统计推断。

自设例子:策略甲每次市场危机都能保护组合,乙在平稳期持续贡献。若只奖励稳定赚钱,可能误删甲;若只奖励平均 Sharpe,又可能误把偶然的一次暴赚当稳定能力。指标要服从组合角色。

原文证据

原文实际报告了什么

SSR 用平均滚动 Sharpe 减去基准,再除以考虑序列相关的长期标准差。重叠窗口必须处理自相关。文章的 ETF 示例中,最大 SSR 组合与最大 Sharpe 组合的年化分别为 8.44% 与 5.90%,回撤却为 29% 与 18%。

原文位置:Definition;Practical considerations;Examples of usage 最后一张表
编辑理解

为什么值得讨论,哪里不能外推

这里最容易误读的是“稳定”二字。收益路径稳定、估计值稳定、尾部风险小,是三件不同的事。一个卖出灾难保险的策略也可能在很长时间内稳定获利,却在极端事件中亏损。我的使用建议是把 SSR 当诊断维度:先明确策略应该在哪种环境赚钱,再检查它是否在那些环境中兑现,而不是机械追求数值最大。

更高 SSR 不等于更低回撤;示例配置不能直接当投资建议。窗口、基准和估计方法都要预先固定。

核查记录

导读完成:核对网页相关方法、结果与限制段落;未逐图及逐行代码审计,未独立复现

四种日期不混用
收录日来源网页日论文首次公开最新版本日
2026-08-24待核待核 / 不适用待核
网页导读核对记录(不是本站回测)
核对项原文 / 状态解读边界
最大 SSR 组合8.44% / 29%文章示例的年化收益 / 最大回撤,不是样本外承诺。
最大 Sharpe 组合5.90% / 18%同一示例的对照;较低收益伴随较浅回撤。
滚动窗口没有通用最优值是平滑程度的选择,不是必须用某个超长年限。

原文位置:Definition;Practical considerations;Examples of usage 最后一张表

推荐 82/100 · 问题 26/30 · 证据 21/30 · 方法 23/25 · 复现 12/15

稳定性问题与重叠窗口处理很有价值;示例配置不构成样本外优越性的证明,代码未独立运行。

尚未执行的实验思路

研究报告并列展示全样本、分阶段和回撤,而不是再加一个可以事后挑高的指标。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

赢过 80 个随机价位仍不够:两跳滑点让 PF 从 1.34 缩到 1.07

Two Strategies Past 80 Meaningless Versions of Themselves. Control Group Told Them Apart

Jan Heger

一句话先讲结论

作者把价位触发规则改成 80 个无意义偏移,发现朴素反应策略的 PF 1.03 被 31 个随机版本打败;更复杂的穿越规则 PF 1.34,80 个对照都没超过它。但加入两跳滑点后,后者 PF 也只剩 1.07,单笔利润从 7.03 美元降至 1.78 美元。统计上不像随机结果,与经济上足够厚,是两个门槛。

它到底在问什么?

一条价格规则的正回测,到底来自特定价位的信息,还是任何差不多的规则在这段市场里都能赚钱?

作者具体怎么做?

  1. 朴素“价位反应”规则样本内 PF 1.03、样本外 0.98,七年中四年为正;80 个随机桶中有 31 个产生更高的最佳单元成绩。
  2. 另一个加入穿越几何与状态过滤的规则有 514 笔交易,作者报告完成率或胜率 58.4%、PF 1.34,超对照约 3.29 个标准差,零个对照更好。
  3. 作者再看年度与样本外,称七年中六年为正,样本内外 PF 分别 1.29、1.38。
  4. 最后加入两跳滑点,胜率降至 53.1%,PF 降至 1.07,单笔收益只剩 1.78 美元,显示执行误差可能吃掉大部分优势。

关键结果

原文结果与口径
核对项结果意味着什么
朴素规则对照位置31 / 80 超过它其正 PF 并未明显超出无信息规则能产生的范围。
较强规则PF 1.34;0 / 80 超过有限随机对照提供支持,不等于真实成功概率 100%。
滑点后PF 1.07;$1.78 / 笔实盘净边际薄,还需检查佣金、延迟和不同市场时期。

怎么理解?

随机对照的价值在于让研究员回答一个更窄、更有意义的问题:不是“赚没赚钱”,而是“宣称有用的那部分信息有没有贡献”。但对照构造本身也是假设。偏移后若交易频次、距离或持仓时间明显不同,就不是只移除了信息,还改变了风险结构。 “零个超过”也不能写成绝对保证。八十个版本之间往往相关,标准差尾概率未必正态;有限样本置换检验通常还需要有限次数修正。文中较复杂规则已经调过几何和过滤条件,其全部搜索历史是否也在对照里重放,是决定证据强度的关键。

最大限制

文章未披露具体品种和完整触发规则,对照的独立性与搜索预算不能核查;完成率与胜率用词混合。作者称已进入实盘,不等于本次已经核验实盘收益。

复现与研究价值

为现有策略设计保留交易频次、持仓和波动暴露的置换对照,把所有参数优化放入每个对照内部;同时给出滑点曲线和打平成本。将“信息检验通过”与“可交易成本预算通过”分别标记,避免一个总分掩盖薄边际。

原文与核查

公开正文全文解析;未核验隐含规则和实盘账户。

原始文章 ↗

推荐 79/100 · 问题 27/30 · 证据 20/30 · 方法 23/25 · 复现 9/15

对照加执行检验的两层框架实用,具体规则和全搜索历史尚不透明。

返回全年目录 ↑

Quantocracy / 导读完成

AI 因子确实拥挤,但不能因此断定是模型权重造成的

Your Research Agent Is an Undisclosed Factor Exposure - And So Is Everyone Else's

Jonathan Kinlay

这篇的反转是:AI 生成的组合很像,但按公开因子文献构造的对照组合更像。拥挤是真问题,归因不能跳步。

2 分钟看懂

两个 AI 团队交出相似策略,是共享模型导致的,还是它们都读了同一批经典论文?

只测 AI 与 AI 的相关性,无法区分模型特有偏差与公开投资知识本来就集中的事实。

编辑自设例子,非作者实验

自设例子:十位研究员都提出动量因子。若十个随机策略更分散,并不足以证明研究员互相抄袭;还要比较十位独立读过经典文献的研究员会多相似。对照组改变,结论就可能改变。

  1. 统一信号语言与股票数据
  2. 各研究运行生成策略组合
  3. 加入随机表达式与文献对照
  4. 分别检验拥挤现象和拥挤成因
关键结果与解释边界
核对项结果意味着什么
随机表达式组合相关性 0.15说明并非同一套工具下什么东西都高度相关。
LLM 研究组合相关性 0.62独立运行仍有较强共享风险。
公开异象组合相关性 0.82比 LLM 更拥挤,削弱“模型权重特有作用”的简单解释。

不能推出什么

单一模型家族、统一价格信号语言和小样本运行限制因果解释;不是跨所有大模型的定论。

研究用途

和 LLM Crowds 一起读:先看最终持仓与收益相关性,再讨论人格或模型的差异。

详细讲解

编辑理解

两个 AI 团队交出相似策略,是共享模型导致的,还是它们都读了同一批经典论文?

只测 AI 与 AI 的相关性,无法区分模型特有偏差与公开投资知识本来就集中的事实。

自设例子:十位研究员都提出动量因子。若十个随机策略更分散,并不足以证明研究员互相抄袭;还要比较十位独立读过经典文献的研究员会多相似。对照组改变,结论就可能改变。

原文证据

原文实际报告了什么

作者在价格信号的统一表达语言下比较组合:随机表达式平均相关性 0.15,LLM 研究组合 0.62,公开异象组合 0.82。8 次运行属于同一模型家族,股票样本也有幸存者限制;未能据此识别模型权重的独立作用。

原文位置:Setup;Results §1、§3;What this does and does not show
编辑理解

为什么值得讨论,哪里不能外推

对量化团队最实际的改变,是把“生成来源”与“风险来源”分开。两个策略由不同模型写出,甚至代码完全不同,也可能在同一天买入同一组股票。反过来,共同使用一个基础模型,也不意味着最终风险相同。更可信的验收是把策略放进组合,观察增量风险和净成本贡献,再问它究竟带来了什么新东西。

单一模型家族、统一价格信号语言和小样本运行限制因果解释;不是跨所有大模型的定论。

核查记录

导读完成:核对网页相关方法、结果与限制段落;未逐图及逐行代码审计,未独立复现

四种日期不混用
收录日来源网页日论文首次公开最新版本日
2026-08-16待核待核 / 不适用待核
网页导读核对记录(不是本站回测)
核对项原文 / 状态解读边界
随机表达式组合相关性 0.15说明并非同一套工具下什么东西都高度相关。
LLM 研究组合相关性 0.62独立运行仍有较强共享风险。
公开异象组合相关性 0.82比 LLM 更拥挤,削弱“模型权重特有作用”的简单解释。

原文位置:Setup;Results §1、§3;What this does and does not show

推荐 86/100 · 问题 28/30 · 证据 22/30 · 方法 24/25 · 复现 12/15

随机与经典文献双对照以及主动撤回过强归因值得读;单模型家族、小运行数和幸存者问题降低证据分。

尚未执行的实验思路

和 LLM Crowds 一起读:先看最终持仓与收益相关性,再讨论人格或模型的差异。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 方法短文

夏普估计不一定是钟形曲线;但拟合 5,000 次重抽样不等于拥有 5,000 份市场证据

Sharpe Ratio Distribution: When Normal's A No-Go, Why Not SHASHo?

Krzysztof Ozimek

一句话先讲结论

作者对两年标普日收益的夏普估计做 5,000 次 bootstrap,发现四参数 SHASHo 分布的 GAIC 优于正态,于是提出用它重写 p 值、临界值、检验功效和最低记录长度。值得关注的是夏普估计的偏斜和尾部,不是立刻替换标准检验:5,000 次来自同一短历史的重抽样,不能增加原市场样本的信息量,也不能保证尾部概率已校准。

它到底在问什么?

即使对自相关、偏度、峰度修正夏普方差,最后仍用正态近似是否会忽略估计分布形状?短样本尤其可能不满足漂亮对称的钟形直觉。

作者具体怎么做?

  1. 作者以两年标普日收益反复计算夏普,做 5,000 个 bootstrap 估计,再通过 GAMLSS 拟合其无条件分布。
  2. SHASHo 使用位置、尺度、偏斜与尾部四个参数,均值并非直接等于位置参数,需要由全部形状推导;作者称四参数显著、GAIC 比正态更好。
  3. 利用该分布到标准正态的变换,作者计划推导单侧检验、临界值、功效与最低记录长度;本篇是四篇系列的第一篇,没有完整展开后续校准实证。

关键结果

原文结果与口径
核对项结果意味着什么
原市场资料两年日收益短历史是可用信息的基础,重抽样次数并不能替代更多独立市场状态。
Bootstrap 次数5,000减少模拟误差,不消除经验样本偏差和重抽样方法的依赖假设。
模型比较GAIC 优于正态作者未在本篇列出详细数值和外部覆盖测试,不能判断改善量级。

怎么理解?

这个问题确实值得问:报告夏普 1.5 时,如果估计分布明显右偏,用对称误差条可能给错误印象。但让一种四参数曲线更贴合 bootstrap 直方图,只完成了拟合,不是检验有效性。真正重要的是在已知真夏普的模拟下,名义 5% 检验是否真的约 5% 误报。 还有一个实践陷阱:把 bootstrap 出来的 5,000 个高度共享同一原样本的估计,当作独立真实观察去计算参数显著性,会夸大证据。应区分条件于这份历史的拟合精度,以及换另一段市场后形状参数是否仍稳定。尾部越灵活,短样本估计风险也越需要控制。

最大限制

本篇只给研究动机和初步拟合,没有具体收益区间、重抽样保留时间依赖的方式、GAIC 数值或外部校准。不能凭系列开篇宣称 SHASHo 已普遍优于成熟夏普推断。

复现与研究价值

在厚尾、自相关和状态变化的已知生成过程上比较正态修正、块 bootstrap 与 SHASHo 的误报率和区间覆盖;把分布选择放在训练阶段,测试阶段只检验覆盖。若改善仅是样本内拟合,应保留更简单稳健方法。

原文与核查

系列第一篇全文解析;未将未读后续篇章内容算作已验证结论。

原始文章 ↗

所讨论夏普方法论文

推荐 63/100(暂定) · 问题 23/30 · 证据 14/30 · 方法 19/25 · 复现 7/15

提出合理推断问题,但当前只是单样本系列开篇,尚缺覆盖率和功效的系统验证。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

分批止盈让盈利变亏损?这篇案例最大的疑点是只改赢家、不重放路径

I Scaled Out to Raise My Win Rate. It Didn't Move — and It Cost Me $115,000

Jan Heger

一句话先讲结论

作者给 3,966 笔期货交易加上“盈利十点先平一半、剩余保本”的规则,称总收益从 +98,683 美元变成 −16,336 美元,胜率仍是 58%。它提醒我们提前兑现可能砍掉右尾,但文末复现步骤要求重新定价赢家、保持输家不变,这不是一般有效的分批退出模拟:输家也可能先碰止盈再反转,必须重放所有交易路径才能确认这 11.5 万美元差额。

它到底在问什么?

提升持仓体验的分批止盈,是否真正提高策略期望收益?衡量对象应是完整收益分布,不是平掉一部分后感觉更安心。

作者具体怎么做?

  1. 作者给出六年半、3,966 笔、单合约基准,胜率 58.0%、PF 1.75、总收益 98,683 美元,平均每笔 24.88 美元。
  2. 对同样交易应用半仓十点止盈与剩余仓保本,报告总收益 −16,336 美元、胜率仍 58.0%,差额约 115,019 美元,正文按 115,020 近似。
  3. 作者把损失归因于赢家右尾被提前截断,举例本来可赚较大目标的交易,途中回撤触发保本而错失后续上涨。
  4. 但公开“可复现”步骤仅要求入场、退出、方向、规模,并称重新定价赢家、输家不变;这些字段不足以知道中途路径与触发顺序。

关键结果

原文结果与口径
核对项结果意味着什么
作者报告总收益+$98,683 → −$16,336退出反事实模拟结果,路径处理未验证,不能直接认定差额全是分批规则造成。
胜率58.0% → 58.0%净赢定义、手续费和保本分类需要说明;半仓已盈利通常不自动等于整笔零收益。
样本3,966 笔 / 6.5 年笔数不解决路径缺失,也不表示这些交易相互独立。

怎么理解?

“砍右尾”确实是趋势和突破策略应检查的风险,但不是所有分批退出必然降低收益的定理。早平一部分同时改变亏损尾部、资金占用和再入场机会;只盯本来最大的赢家会产生反向选择偏差。 因此这篇最好的用法不是抄结论,而是把它当作反事实回测审计题。必须按同一价格路径对两套退出规则逐笔并行模拟,再解释哪些原赢家变小、哪些原输家转正、哪些触发保本。没有这张转移表,“体验优化损害收益”的故事仍可能混入不对称计算。

最大限制

未披露完整品种、价格频率和触发顺序,单合约如何实现半仓也需说明。文章对赢率不变的解释不足,公开复现步骤可能系统性低估分批变体;本次没有交易流水,不能确认原程序是否也犯了该错误。

复现与研究价值

获取逐笔或足够细的 OHLC 路径,保守处理同一根内同时触及止损止盈,并统一费用、最低合约和再入场约束。用原赢家/输家与新赢家/输家的四格收益归因验证差额;若路径不可得,就不能据终点收益模拟这种退出。

原文与核查

公开正文全文解析并检查复现逻辑;原始交易路径未取得。

原始文章 ↗

推荐 58/100(暂定) · 问题 23/30 · 证据 13/30 · 方法 15/25 · 复现 7/15

提醒收益尾部重要,但反事实路径和只改赢家的公开步骤存在重大审计问题。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

议员 ETF 跑赢 SPY 近 13 点,扣掉更高 Beta 后 Alpha 却接近零

Autopsy No.005: The congressional-trading ETF that beats the market

Morgue Labs

一句话先讲结论

NANC 在文中样本累计涨 108.8%,SPY 涨 96.1%,看上去证明跟随议员有效;但 NANC 对 SPY 的 Beta 为 1.138,回归年化 Alpha 为 −0.89%、t=−0.37。换 QQQ 作基准,Alpha 又变成 +1.84% 但仍不显著。最稳妥的结论是这 40 个月没有识别出超越风险暴露的选股能力,而不是证明议员信息永远无用。

它到底在问什么?

主题基金的跑赢究竟是主题信息有效,还是在行情有利时多承担了科技和市场风险?真实产品业绩也需要匹配风险的反事实基准。

作者具体怎么做?

  1. 以 2023-03-31 至 2026-08-11 的 40 个左右月度观测比较 NANC、SPY、QQQ,区间不含基金成立后的最初七周,末期也并非完整月末。
  2. 分别回归 NANC 对 SPY 和 QQQ 的月收益,报告 Beta、截距与 t 值,不只选择有利于结论的一种基准。
  3. 检查科技和通信权重及大型科技持仓,用持仓风格解释为何 Nasdaq 比大盘更相关;同时讨论另一议员主题产品 KRUZ 的表现。
  4. 作者承认这是收到问题后进行的描述性分析,没有预注册,也不是机械复制披露交易策略的干净实验,因为 NANC 还含主动管理决策。

关键结果

原文结果与口径
核对项结果意味着什么
累计收益NANC 108.8% / SPY 96.1%原始差额约 12.7 个百分点,尚未调整暴露。
SPY 回归Beta 1.138;Alpha −0.89%/年t=−0.37,不显著;不能称为确定负能力。
QQQ 回归Alpha +1.84%/年t=0.58,同样不显著,说明基准选择影响点估计。

怎么理解?

这篇适合用来训练对真实产品的归因习惯:回测可能有数据偏差,真实基金也仍可能只展示幸运风格暴露。收益来源解释应从简单可买基准开始,而不是先为主题编一个信息优势故事。 但作者一些修辞也比证据更强。不同党派组合表现不同不必然否定全部信息优势,它们可能持仓、执行和披露结构不同;相关基金是否停止、其价格终点是否代表清盘也应查基金正式公告。本解析保留回归能支持的窄结论,不把“另一产品失败”当因果实验。

最大限制

40 个月对 Alpha 的估计很不精确;作者给出的年化区间约 −5.5% 至 +3.9%。单因子、未扣无风险利率、可能非整月观测均需改进;本次未独立核验基金最新费率、存续状态和完整净值,因此不转述为当前产品事实。

复现与研究价值

用正式 NAV 总收益与完整月末数据复核,并加入市场、行业、规模成长等暴露;按披露可见日构造机械组合,与基金主动选择部分分离。至少报告两种匹配基准和置信区间,避免只展示战胜 SPY 的累计曲线。

原文与核查

公开正文全文解析;未独立下载基金净值或核查最新存续状态。

原始文章 ↗

推荐 80/100 · 问题 26/30 · 证据 22/30 · 方法 22/25 · 复现 10/15

风险归因与置信区间清楚,适合拆主题叙事;短样本及产品状态仍需官方核查。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

长期买虚值期权会付出波动溢价,但“月亏 68%”不能代替真实期权链检验

Autopsy No.003: Buying options for the big win

Morgue Labs

一句话先讲结论

作者用 2006—2026 年指数与波动率资料模拟每月买虚值宽跨,报告 5% 虚值组合平均每月损失约 68%,并把原因归为隐含波动长期高于随后实现波动。但这是用波动率模型给期权定价的模拟,不是逐张真实期权成交记录;它能提醒“有限亏损不等于便宜”,还不能证明所有买方策略都没有条件优势。

它到底在问什么?

反复付一笔小权利金等待大行情,能否靠少数彩票式赢家补足日常损耗?要比较的不只是收益凸性,还包括为了获得凸性实际付了多少钱。

作者具体怎么做?

  1. 作者比较隐含与随后实现波动,报告前者平均高约 3.4 个波动点,并在 82% 的日子差值为正。波动差与方差风险溢价并非完全相同量纲。
  2. 按模型模拟 5% 与 10% 虚值月度宽跨,称前者平均权利金收益约 −68%,后者接近完全损失。正文没有完整展示每月期权链与现金流。
  3. 再按期限结构倒挂的恐慌状态拆分,作者称最有利状态仍损失约 55%;具体筛选阈值和交易时点需看实现。
  4. 文章另批评 gamma squeeze 研究的未来事件定义与散户损失文献,但未在正文给出足够可核查书目信息,不能把这些不同市场样本自动合并为对全部买方的证明。

关键结果

原文结果与口径
核对项结果意味着什么
隐含减实现波动约 3.4 个波动点作者样本描述,不等于所有执行价、到期与状态的同一风险溢价。
5% 虚值月度宽跨约 −68% / 月模型中的权利金收益口径,不是完整资产配置组合月收益。
恐慌状态模拟约 −55% / 月未经真实期权报价与可见时点复核的条件结果。

怎么理解?

最基本的逻辑是正确的:凸性有价格,买到极端大涨可能性不代表得到正期望。截图只展示成功者,也确实会严重夸大买方长期体验。但风险溢价是对尾部风险和保险需求的补偿,不足以推导所有期权买入都错误;以保险目标买入和以独立获利目标买入,应使用不同评价基准。 研究上必须警惕“模型给出的坏结果”被描述成市场已彻底证伪。VIX 对应的是一篮子方差预期,不是任一虚值看涨或看跌的实际报价;忽略偏斜也不保证对两翼统一偏向买方。更不应从买方负期望直接跳成推荐卖方,卖方承担的极端损失和保证金压力正是溢价来源。

最大限制

公开正文缺少可运行定价代码、真实合约链和所引散户论文的完整验证;日内交易者损失比例不能自动归为期权买方结果。本文解析的是作者论证及局限,不独立确认其所有数值。

复现与研究价值

用真实点时期权链,固定 moneyness、到期日和入场时点,按买卖报价执行,分别报告权利金收益与资本占用收益。分离无条件长期买入、事件条件买入与保险用途,检验尾部收益和最大追加资金需求,而不是只看平均亏损比例。

原文与核查

公开正文全文解析;未取得完整定价代码和真实期权数据。

原始文章 ↗

推荐 57/100(暂定) · 问题 21/30 · 证据 14/30 · 方法 16/25 · 复现 6/15

警惕彩票式期权叙事有价值,但模型与真实合约的距离、过强结论和文献细节不足明显。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

新闻正负组次日差 0.45%,但只有三篇以上报道的公司日才出现

Does AI Still Read the News Better Than the Market?

Tommi Johnsen / Svetlana Shasharina

一句话先讲结论

作者在 2026 年约六周、850 家美国公司的新闻中发现:每天至少三篇报道的公司,正负新闻组次日收益差约 0.45 个百分点;少于三篇的组没有可辨识效果,第二天又回吐约三分之一。更关键的是周末新闻没有同样即时关系,提示模型可能部分在读“已经涨了”的报道。它支持继续研究新闻覆盖与信号可信度,不支持把 0.45% 当每日可赚收益。

它到底在问什么?

大模型新闻效应是否随着普及消失?作者进一步发现,情绪分数的分母把一条新闻和许多条一致新闻混成同样强的分数,可能遮蔽真正有信息的样本。

作者具体怎么做?

  1. 夜间收集约 850 家公司的标题,让模型只确认新的、具体、可核实且与目标公司相关的信息,约八成被视为中性;六月末增加公司归属过滤,排除代码歧义。
  2. 按公司日形成情绪分数,再分至少三篇和少于三篇两组,分别观察当日、次日与后续收益差。
  3. 作者报告覆盖充分组次日差 +0.45%,第二日方向部分反转;还检查大公司,认为反转不只是微盘报价反弹。
  4. 用一千次两类打乱对照:公司内跨日期打乱破坏时点,公司日内跨公司打乱破坏对象。真实结果超过两类随机范围,但这是六周内的统计证据。

关键结果

原文结果与口径
核对项结果意味着什么
覆盖充分组次日差+0.45 个百分点正负新闻组均值差,不是投资组合的日净收益。
分组门槛每天至少 3 篇本次分析里的发现性阈值,需新样本冻结验证,不能视作普适常数。
样本长度约 6 周横截面公司多不等于拥有许多独立市场环境。

怎么理解?

实务上最有价值的是保留证据数量。仅输出 −1 到 +1 的标准化情绪,会让稀疏公司的极端值冒充高信心;可以把条数、独立媒体数、新事件数与分数一起交给预测系统,而不是只按幅度排序。 不过,多篇新闻也可能是同一消息复制,而非独立确认。覆盖数还与公司规模、财报日和波动有关,三篇门槛可能是在选择更活跃事件。周末对照提出逆向因果疑问,但周末与交易日的新闻类型不同,不能单靠它证明当日关系全部来自报道价格。标题时点与交易时点仍是更直接的检验。

最大限制

不同模型、币池之外的公司样本和价格频率与原论文不一致,作者也不称精确复现。新闻归属过滤中途改变、样本短、分组门槛事后发现;没有实施交易策略、费用与隔夜日内分解,不能据此宣布原论文的效应衰减预测已被推翻。

复现与研究价值

冻结公司归属与新闻去重规则,按最早公开时间分盘中、盘后和周末,并让三篇阈值接受后续数据检验。比较独立事件数与转载数,按行业与财报日匹配对照,再检验从实际可下单时刻起的增量收益。

原文与核查

公开正文完整解析;作者更详细技术附录未取得,未重跑新闻模型。

原始文章 ↗

推荐 81/100 · 问题 28/30 · 证据 21/30 · 方法 23/25 · 复现 9/15

证据数量与时间戳的拆解贴近实务,随机对照不错;六周和流程变动限制外推。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 论文导读

策略 B 是否优于 A,要看收益分布;但事后市场状态不是可提前下单的信号

Trading Strategy Comparison: Is B Really Better Than A?

Krzysztof Ozimek

一句话先讲结论

论文把 2002—2025 年标普样本分成 146 个向前测试窗口,发现 SVM 与买入持有的优劣会随状态和评价维度改变。最值得注意的不是某个模型赢了,而是它比较的 IR* 把负均值窗口全部压成零,且“状态”取自当段已经实现的收益与波动;所以它更适合事后解释表现,不能直接据此说知道下一段该选哪条策略。

它到底在问什么?

用一个全样本夏普给策略排名,会把不同环境下的均值、离散程度和失败概率压在一起。是否可以分别建模这些维度,让研究员知道优势来自更高平均表现还是少数极端好窗口?

作者具体怎么做?

  1. 策略层以 160 日训练、40 日测试非重叠推进;技术指标只用滞后值,缩放与多空阈值在训练内确定。
  2. 每个测试窗口计算非负 IR*,再用包含零点质量与正值 Gamma 部分的 ZAGA 分布,把位置、离散和零概率与策略及市场状态联系起来。
  3. 作者在六个状态点比较条件均值、方差和均值/标准差,报告不同维度不必由同一策略占优。本文关注的是这套比较结构,不把拟合值当交易收益率。

关键结果

原文结果与口径
核对项结果意味着什么
向前评估窗口146 个是同一指数历史的窗口,并不是 146 个独立市场。
训练 / 测试160 / 40 日策略回测的设置;后续状态解释模型仍需独立验证。
绩效变量负均值窗口 IR*=0适配零调整分布的同时丢弃了亏损大小信息。

怎么理解?

从单一分数升级到分布,方向有用,但首先要选对被建模的对象。如果原指标把亏损尾部截掉,漂亮的条件密度也可能掩盖投资者最关心的差异。建议同步保留窗口净收益、最大回撤和亏损严重度,不让 IR* 成为唯一判决变量。 状态变量的时点尤其关键。用窗口结束后才知道的涨跌和波动解释谁赢,是合理的归因;拿同一状态去安排窗口开始时仓位,就是未来信息。另一个推断疑问是文中用拟合分布直接抽样、统计两者差值符号,再称 p 值:这与在零假设约束下构造频率学检验并非自动等价,还应把参数估计误差和同窗口配对依赖纳入。

最大限制

本次读作者介绍并核查原论文关键方法和结果,未复算;没有可据此确认的扣费实盘优势。条件点可能组合各变量相同分位而非实际常见联合状态,极端外推与模型分离问题需要谨慎。

复现与研究价值

先用配对窗口差值做简洁诊断,再考虑分布模型是否增加解释力;若用于策略配置,所有状态必须在窗口开始时可知,且分布模型只能在更早窗口训练。以保留配对和时间依赖的重抽样检验差异,并报告模型不确定性而非只报拟合参数的模拟结果。

原文与核查

作者短文完整解析;原论文关键定义、方法和结果核查,未独立复算。

原始文章 ↗

原论文与 PDF

SSRN 版本

推荐 77/100 · 问题 25/30 · 证据 21/30 · 方法 21/25 · 复现 10/15

分布化比较有方法价值,但指标截断、事后状态和参数模拟检验仍有关键边界。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

触及整数位概率多 14.7 个百分点,为什么还不是能赚钱的交易?

The Statistic That Passed Every Test I Had And Still Isn't an Edge

Jan Heger

一句话先讲结论

作者发现价格位于整数位下方时,首日到达该价位的比例为 67.4%,随机位置对照为 52.7%,样本 11,697 个;但把这个现象变成订单后,入场延迟、先触止损再到目标和盈亏比让优势消失。有一个版本胜率从 62.1% 升到 62.7%,总收益反而少了 1,160 美元:最终到达目标的概率,不等于在交易约束下先赚钱的概率。

它到底在问什么?

一个统计现象即使显著,是否存在可以实际捕捉它的订单结构?本文区分终点事件发生概率与完整交易路径收益。

作者具体怎么做?

  1. 作者在日间缺口相关观察中记录整数位附近的首日路径完成,报告 N=11,697,真实与随机位置差为 14.7 个百分点。
  2. 尝试用实际交易规则捕捉现象,发现成交太晚、途中先止损或盈亏比恶化等问题;文章未完整公开这些交易变体。
  3. 进一步判断首日以后所谓磁吸更可能只是区间中回访近期价位,而非整数本身吸引价格;这属于作者解释,不是本文独立证实的微观机制。
  4. 最终把信号放入只记录、不下单的前向账本,等待冻结后真实新数据,而不是因为一个统计值漂亮就投入资金。

关键结果

原文结果与口径
核对项结果意味着什么
目标触及率67.4% vs 52.7%首日形态完成,不是成交后的净盈利概率。
样本量11,697相邻事件是否重叠未披露,有效独立样本量可能更小。
一项交易变体胜率 +0.6pct;收益 −$1,160说明提高胜率可以同时降低收益,金额是作者案例而非通用效应。

怎么理解?

这个区分能直接改进信号研究。到达目标、最终收涨、未来最高价超过某水平,都可能是有信息的标签,但它们并不指定可执行路径。研究员应在模型训练前确认标签与最终下单决策的关系,否则分类成绩越高,可能只是更擅长预测自己无法捕捉的事件。 同时作者说“随机对照已经排除多重比较”太强。若在很多距离、时间、整数级别和样本里试过,只挑这一个对照差最大的结果,仍有选择问题。对照提供必要背景,不自动替代全研究流程的搜索校正;缺少机制也不必直接否定统计套利,但需要更严格的可迁移证据。

最大限制

具体市场、随机位置如何匹配距离、波动与时间、交易费用及全搜索历史都未充分公开;作者的无机制判断不能证明效果不存在。前向账本尚未给出足够后续样本。

复现与研究价值

先把事件改为在固定时间内先触目标还是先触止损,并用可成交价格计算收益;随机位置必须匹配距当前价距离和日内时点。锁定规则做只读前向记录,记录未成交与取消单,最后评价净期望而不是目标完成率。

原文与核查

公开正文完整解析;未独立重跑价格事件或前向记录。

原始文章 ↗

推荐 74/100 · 问题 26/30 · 证据 18/30 · 方法 22/25 · 复现 8/15

统计可预测与交易可捕捉的区别非常实用;原始实验细节和多重比较仍不透明。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

五资产月度轮动规则很简单;12.5 万次搜索才是 11% 年化背后的关键成本

Quick 5 ETF Rotational Strategy Returns the Upside of Stocks with Half the Risk

Stuart Farmer

一句话先讲结论

每月把股票、债券、地产、商品和黄金五只 ETF 按 1、3、6、9、12 个月平均收益排序,等权持有前三只,作者报告约 11% 年化、0.87 夏普和约一半的股票回撤。规则看起来只要六步,但文章最后才披露它来自 12.5 万多个轮动组合的搜索;因此好看的是获胜配置的历史表现,不是未经筛选的策略证据。

它到底在问什么?

把多个动量窗口平均,再在资产类别间轮动,能否兼顾股票收益与较低回撤?真正需要回答的是,这个特定五资产集合和前三名持有数,在未参与选型的数据里是否仍有优势。

作者具体怎么做?

  1. 每月最后交易日对五只 ETF 分别计算过去 1、3、6、9、12 个月的累计收益,取五个收益的算术平均作为混合动量。
  2. 从高到低排序,选前三个,每个配置三分之一资本,持有到下个月末再平衡。没有绝对动量为负时退出到现金的规则,因此差环境也仍然满仓某三类资产。
  3. 正文宣称低换手,并展示不加费与按换手 10bp 收费的结果;具体图表的区间和全部数值没有在文本逐项列出。
  4. 作者称该篮子来自 125,000 多个轮动策略组合的搜索,完整搜索与策略实现放在付费文件夹,而非公开正文可独立审计的冻结实验。

关键结果

原文结果与口径
核对项结果意味着什么
作者报告绩效CAGR 11%;Sharpe 0.87尚未核验完整图表和搜索后的真正持出结果,不是可承诺预期。
搜索规模125,000+候选组合存在相关性,不能机械当成独立检验次数,但必须计入研究自由度。
资产与仓位5 选 3,等权始终选择相对强者,不保证所选资产绝对收益为正。

怎么理解?

这是一条容易实现、也容易误读的规则。多窗口平均并非独立五次确认:这些收益窗口高度重叠,长期涨势会同时抬高多个分量。五资产本身的分散可能已经减少大量回撤,应通过静态组合对照将资产配置与择时贡献分开。 最重要的披露其实是搜索次数。不能因为最终策略简单,就把产生它的研究过程也视为简单。加入新 ETF、换掉地产、选前一还是前三,都是模型选择;只有把整个搜索步骤放进训练集,并在外层独立验证,才知道这个赢家是否只是幸运路径。

最大限制

完整代码和搜索记录需要订阅,本次未取得;公开文字未充分交代样本区间、总收益复权、调仓时点和严格外层样本外。评论区的负面复现意见也未独立验证,不作为本文事实结论。

复现与研究价值

按公开规则先复现基线,同时加入五资产静态等权、简单单窗口动量和随机篮子分布。以较早区间完成全部资产与参数选择,后段只执行一次;对不同月内交易日和次日成交检验稳健性,而不是再挑最好日期。

原文与核查

公开正文全文解析;付费代码和完整绩效表未核验。

原始文章 ↗

推荐 66/100(暂定) · 问题 22/30 · 证据 16/30 · 方法 17/25 · 复现 11/15

规则透明易实现,搜索规模披露诚实;但未经完整搜索校正的获胜绩效证据有限。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

Supertrend 一小时亏 92.9%:换成四小时赚钱,也不等于入场信号有效

Supertrend, flipped to death: the most-taught indicator on the internet

The Refutation

一句话先讲结论

在作者的 BTC 一小时样本里,Supertrend(10,3) 每次变色就反向持仓,1,239 次翻转后累计亏 92.9%,买入持有同期涨 940%;改成四小时虽然赚 238%,仍落后买入持有的 828%。文章最有用的检查是固定交易节奏再随机方向或入场,说明正收益可能只是持有上涨资产,而不是指标选对时机。

它到底在问什么?

图上紧跟趋势的线,按下一根开盘真实执行后是否仍有择时信息?视觉上解释过去行情,与提前给出可执行优势并不是同一件事。

作者具体怎么做?

  1. 作者用 BTC 一小时数据运行公开常见参数和始终在场规则,手续费按来回 0.11%,共 1,239 次翻转;文中说样本约 6.3 年,未完整列出起止日。
  2. 移除最好五笔后损失 −97.8%,移除最差五笔仍 −87.5%,说明失败不只由个别极端交易推动。
  3. 固定同样交易时点、持有期和成本,随机方向 5,000 次,与真实指标比较。作者报告随机中位数约 −91.2%,真实 −92.9%。
  4. 再比较四小时及其他资产,并对四小时多头入场做同持有期限的随机对照;作者称所有测试持有期的入场差均为负。

关键结果

原文结果与口径
核对项结果意味着什么
BTC 一小时−92.9% vs 持有 +940%特定参数和执行方式的回测,不是所有趋势策略结论。
BTC 四小时+238% vs 持有 +828%正收益没有自动转化为相对市场的择时优势。
成本前后单笔均值−0.024% → −0.134%费用约占算术单笔损耗的 82%;不能直接解释复利净值的同比例下降。

怎么理解?

文章好的地方是没有停在“亏钱所以没用”,而是进一步问亏损来自成本还是方向判断。如果毛单笔本来就略负,高频反向交易的费用会持续侵蚀;降低频率可以改善结果,却不代表信号突然有了新信息。 不过,随机对照表述有一处内部疑点:若真实收益 −92.9% 低于随机中位数 −91.2%,按通常定义至少一半随机结果应比它高,正文却说只有约 44% 超过,需查图或代码。类似细节提醒我们,“打假文章”也需要审计。长期多空与买入持有的风险不同,还应比较波动匹配基准。

最大限制

未提供本次可执行代码与完整数据区间;手续费在翻转时如何计算、现货或永续空头资金费、随机试验百分位需核查。删除好坏交易是敏感性描述,不是可交易的策略修正。

复现与研究价值

冻结参数,用真实可交易工具加入融资或资金费,对比波动匹配持有与固定信号时点随机方向。核验随机百分位和成本复利账本,再做更换频率但不重新选最优参数的独立验证。不要将某个失败配置直接推广成整个指标家族无效。

原文与核查

公开正文全文解析;完整订单和随机实验未独立复核。

原始文章 ↗

推荐 74/100(暂定) · 问题 24/30 · 证据 20/30 · 方法 22/25 · 复现 8/15

成本与随机入场对照实用,但随机中位数和胜出比例存在内部不一致需复查。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 统计短评

六七月连跌后,13 次九月有 11 次下跌;小样本季节性不是 85% 的预测概率

Down June & July: 11 of 13 Septembers Closed Lower

Rob Hanna

一句话先讲结论

作者统计 1950 年以来标普指数六月、七月都收跌的年份,发现随后九月 13 次里有 11 次下跌,而八月方向不明显。它提供了一个具体的条件季节性观察,但 11/13 只是历史频率;如果月份组合和触发条件是从许多候选里挑出来的,就不能直接把约 85% 当成下一次下跌概率。

它到底在问什么?

在通常偏强的六月和七月连续走弱后,传统偏弱的八九月是否会进一步恶化?作者尝试把季节性与前期价格状态结合,而不只看无条件月份均值。

作者具体怎么做?

  1. 以 1950 年以来 SPX 月收盘变化筛选六月和七月均为负的年份,这是本次条件样本的定义。
  2. 观察这些年份的八月、九月表现。作者称八月有涨有跌,九月不论八月是否反弹都偏弱。
  3. 正文给出九月 13 次中 11 次收低,并提到部分跌幅较大;逐年表格以图片呈现,本次未从正文得到平均跌幅、最差值或每个年份。

关键结果

原文结果与口径
核对项结果意味着什么
条件样本13 次是较长历史中少量触发事件,不能把全部月度数据当成有效样本量。
九月收跌11 / 13约 84.6% 的历史频率,不是经样本外校准的预测概率。
八月方向不明确作者文字判断;未报告可复核的完整收益矩。

怎么理解?

研究员可以把它当成需要解释的现象,而不是即刻变成空头仓位。连续两个月下跌可能已经代表某些危机环境,而这些环境往往也影响后续收益;用日历名称包装后,不代表机制来自日历本身。 短文的优点是问题和计数清楚,没有复杂模型遮挡。缺点是筛选自由度没有账本:可以试很多月份、连续长度和涨跌阈值,最终只报道一个漂亮条件。即使简单二项检验显得有意义,若忽略这层选择,也会高估证据。

最大限制

没有逐年原始表、完整收益分布、多重检验校正或预注册规则的核验。当前行情与未来月份判断不在本解析范围;本文只分析作者统计设计,不给出仓位建议。

复现与研究价值

按同一规则重建所有月份的相邻两月下跌事件,对比无条件季节性与趋势条件,并做逐事件剔除检查。若效果集中于两三场危机,应报告这一事实;只有冻结规则后的后续事件才可增加真正样本外证据。

原文与核查

公开短文完整阅读;图片逐年统计未逐格核验。

原始文章 ↗

推荐 55/100(暂定) · 问题 16/30 · 证据 15/30 · 方法 13/25 · 复现 11/15

问题明确且容易复核,但 13 次事件和未披露搜索过程不足以支持高置信度择时。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 方法教程

给波动预测加 90% 区间很有用,但示例代码把测试段用于早停了

Conformal Prediction in Quantitative Finance

Vertox

一句话先讲结论

文章把单点波动预测改为上下分位数,再用 CQR 与自适应校准追踪 90% 覆盖率,方法方向比只报一个预测值更实用。但公开代码先把 val_data 分成校准和测试两半,训练时却仍把整个 val_data 用于早停选择权重;所以展示的测试覆盖并不是完全未见数据上的验证。学方法可以,漂亮区间图不能直接当独立样本外证据。

它到底在问什么?

一个波动点预测无法告诉仓位系统自己有多不确定。能否给任何预测器套上有明确覆盖含义的区间,同时允许波动误差偏斜、厚尾和随时间变化?

作者具体怎么做?

  1. 把 NARX 网络改成两个输出,用 pinball loss 训练 5% 和 95% 条件分位数,避免同一宽度套在安静与高波动阶段。
  2. 在校准集计算真实值超出上下界的最大距离,再用带有限样本阶数修正的分位数扩张或收缩区间。交换性是普通 conformal 的关键条件,金融时间顺序通常不满足。
  3. ACI 按当期是否漏覆盖更新 alpha_t,步长示例为 0.01;漏太多就扩宽。它追求长期平均错误率控制,不是无条件恢复逐点、任意状态的有限样本保证。
  4. 示例使用 30 个滞后、370 隐单元等原点预测超参数,训练早停却监控整个 val_data;其中后半随后又称 test_data,构成模型选择层面的测试污染。

关键结果

原文结果与口径
核对项结果意味着什么
名义区间90%设计目标,不是本次独立验证的实际测试覆盖率。
自适应步长gamma=0.01作者示例设定,响应快慢需要训练内选择,不能反复用最终测试调。
验证缺口测试半段参与早停公开代码可直接识别的依赖关系,影响漂亮测试图的解释。

怎么理解?

方法层面最值得带回的是把区间宽度也当成模型质量。随便给出极宽区间总能高覆盖,但没有仓位价值;必须同时报告覆盖、宽度和按波动状态分组的漏覆盖,才能知道系统是否只靠保守保住一个总比例。 代码层面还有两点值得复核。它把 alpha 限制到 [0,1],并对超出分位数范围返回无穷界,必须确认这与所引用 ACI 定理的边界处理一致,不能只口头引用保证。校准分数在测试中固定而只调 alpha,也不等于完整滚动重新校准。文章方向正确,工程实现仍需与数学假设逐项对齐。

最大限制

未独立执行神经网络;前序训练数据和模型说明依赖另一篇文章。当前示例测试早停污染、时间序列交换性及 ACI 边界处理,都使无条件覆盖宣传需要收窄。

复现与研究价值

按时间分为训练、超参数验证、校准、最终测试四段;模型训练和早停只接触前两段,校准不参与权重选择。冻结 gamma 后向前运行,报告总体与危机段覆盖、平均宽度、无穷区间比例及连续漏覆盖长度,再评估仓位用途。

原文与核查

公开正文及全部示例代码已读;发现早停与测试段重叠,未独立运行。

原始文章 ↗

推荐 86/100 · 问题 28/30 · 证据 23/30 · 方法 23/25 · 复现 12/15

教程和代码具体、可审计,区间思想实用;发现的测试污染必须修复后才可相信展示。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

58.4% 胜率通过四道检验,却死在限价单成交规则上

The 58% Win Rate That Was My Own Code Lying To Me

Jan Heger

一句话先讲结论

MNQ 在特定尾数价位买入、止盈止损各 25 点,作者得到 58.4% 胜率,跨年份和样本外都看起来稳定;但将“碰到价格即成交”改成必须穿过限价 2 点,胜率降至 53.1%,每笔收益从 7.03 美元降到 1.78 美元。问题不在预测模型,而在回测把最难成交的反弹赢家全算进去了。

它到底在问什么?

一个通过随机价位对照、逐年稳定性和样本外检查的策略,为什么仍可能完全不可交易?

作者具体怎么做?

  1. 最初池化的 5,551 笔交易胜率 51.5%,随机水平约 50.7%;筛出的 x466 桶有 514 笔、胜率 58.4%、利润因子 1.34。这里已经发生过选优,因此必须比较同样被搜索的对照。
  2. 80 个对照桶最高胜率 55.2%;x466 在七个年份中六年盈利,以 2024 年为界的样本内外胜率为 57.9% 和 58.8%。这些检验沿用同一个成交假设,不能识别共享的模拟错误。
  3. 把所需穿透幅度从 0 调到 1、2、3、5 点,胜率依次为 58.4%、57.2%、53.1%、51.9%、45.6%;利润因子同步从 1.34 降到 0.79。
  4. 在更保守成交下扫描 5 档止盈与 4 档止损,20 格中 19 格亏损;最佳利润因子 1.03,而对照桶各自最佳值均值 1.01,80 桶中 31 桶比候选更好。

关键结果

原文结果与口径
核对项结果意味着什么
穿透 0→2 点58.4%→53.1%胜率下降 5.3 个百分点,反映成交筛选而非手续费简单上调。
每笔收益$7.03→$1.78仍是作者模型报告值,未独立核对逐笔成交。
同样选优后的负对照31/80 更优参数扫描后的候选并不突出,不能只看它自己的最佳格子。

怎么理解?

这篇的实用价值,是说明样本外不能修复结构性错误:如果历史与未来都使用“触价必成交”的代码,两个区间会一起虚高。首先应审查订单能否成交,再研究显著性。 不过,穿透 2 点也不能被命名为已验证的真实成交率,穿透更多必然改变入选交易的路径分布;它是有方向的压力测试,不是订单簿回放。作者把单调衰减视为伪优势指纹很有启发,但最终仍需报价、成交量、排队与实际委托记录确认。

最大限制

未取得逐笔数据和代码,美元损益、滑点与微型合约摩擦未独立重算;x466 缺少事前经济机制,初筛与后续检验亦非完全独立。

复现与研究价值

在自己的限价策略中同时保留触价、穿透与成交量约束三套结果,再用真实小额委托校准填单概率;候选和随机水平必须采用完全相同的参数扫描预算。这是建议,未执行实盘或回测。

原文与核查

公开全文和全部文字表格已读,未运行作者脚本。

原始文章 ↗

推荐 86/100 · 问题 29/30 · 证据 23/30 · 方法 24/25 · 复现 10/15

执行偏差案例具体,负对照设计有用;缺少订单级独立验证。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 论文导读

LAFO 的贡献是定义价格滤波目标,不是证明夏普 11 的反转策略

Fair Value as an Adaptive Low-Pass Filter: LAFO for Mean Reversion

Ali H. Askar;原论文 Zhichen Xu 等

一句话先讲结论

这篇导读中的两层 CNN 在两个月、2 分钟标普数据上得到夏普 11.049,EMA(10) 却为 −18.265;但没有正式样本外评估,所以不能据此认定神经网络找到可交易的公平价值。值得研究的是 LAFO 把“拟合每个价格点”改成“控制局部平均残差”,让平滑尺度和价格结构假设变得明确。

它到底在问什么?

均值回归策略先要回答“回到哪里”:移动均线只是一个平滑基准,不是经济学上的真实价值,过慢会把永久价格变化误认成暂时偏离。

作者具体怎么做?

  1. LAFO 对长度 K 的窗口内残差先求均值,再对均值平方求和;K=1 退回逐点平方误差,较大 K 更强调低频匹配。
  2. 通过总变差、一阶平方差或二阶绝对差约束,分别表达分段常数、平滑漂移或分段线性价值路径。正则项不只是技术附件,也是在选择市场状态变化的形状。
  3. 交易根据现价相对滤波线的偏离反向持仓,设 0.0005 的入场死区和 200 的仓位缩放;小偏离不交易,超过死区后才逐渐放大至上限。
  4. 演示统一 K=80、每单位换手 3 bp 成本,约 6,000 个样本;两层 CNN、WaveNet、深度 Kalman 的报告夏普分别为 11.049、8.005、4.920。原作者将研究定位为方法展示,未给出系统样本外结论。

关键结果

原文结果与口径
核对项结果意味着什么
CNN 演示夏普11.049短单资产样本内展示,不是可部署业绩。
样本尺度两个月、2 分钟高频观测很多不等于独立市场状态很多。
交易死区5 bp偏离阈值,不是显著性门槛或风险预算。

怎么理解?

研究员真正可以借用的是把“均线多少天”拆成两个决策:保留什么频率、允许价值路径怎样转弯。这样模型优劣就能追溯到可检验的假设,而非只比较一张平滑图。 还要比导读再谨慎一步:损失对滤波输出凸,不意味着神经网络参数训练凸;全样本离线曲线转弯快,也不代表在线因果滤波没有延迟。K 很大只约束平均残差,若没有正则,平坦全局均值亦不必是唯一解。将这些层次混在一起,会把漂亮数学变成错误交易直觉。

最大限制

已读完整导读并核对正确原论文摘要,尚未取得逐页全文及代码;所有细项为导读报告。未核查在线因果性、训练测试切分和成交工具,不能把标普指数直接视为可成交资产。

复现与研究价值

先在每个时点只能用历史数据的管线中实现 LAFO 与 EMA,冻结 K 和正则选择,再比较跨期预测残差、换手及可交易期货净收益;方法验证和策略选择分开。

原文与核查

公开导读完整解析;正确原论文书目与摘要核验,未逐页审计。

原始文章 ↗

原论文:Advanced Signal Filtering for Mean Reversion trading

推荐 76/100(暂定) · 问题 27/30 · 证据 18/30 · 方法 23/25 · 复现 8/15

目标函数有研究价值,短样本内收益和正文引用错误要求审慎。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

50/100 均线带的 55 种交易版本:视觉上的趋势,未能跨过手续费

We tested the 50/100 MA ribbon 55 different ways over five years

The Refutation

一句话先讲结论

作者把 BTC、ETH 的 50/100 均线带翻色交易做成 55 种配置,2021 年 2 月至 2026 年 7 月扣费后总收益全部为负;其中 37 种连扣费前也亏损。60 分钟反手版本亏 59%,5 分钟版本约 11,000 次交易后接近归零:这首先否定这组频繁翻色规则,不是否定所有趋势策略。

它到底在问什么?

均线带看起来能区分趋势和震荡,但颜色改变发生后,是否还有足够的未来收益覆盖反复交易的成本?

作者具体怎么做?

  1. 以五年多的一分钟 BTC、ETH 数据生成多时间尺度信号,测试三种翻色严格度和反手/中性空仓两种退出模式,共 55 格配置;每次只允许一个持仓。
  2. 信号在 bar 收盘确认,下根开盘成交。每边 taker 费约 0.055%,往返约 11 个基点;未模拟永续资金费,因此不是包含全部持有成本的完整实盘损益。
  3. 分解毛收益与费用:37 格扣费前亏损,12 格毛收益为正但被费用吃掉;另六格平均净单笔优势略正,但复利总收益仍负且无显著性。两者不能混称同一收益指标。
  4. 反手模式随频率提高,60/30/15 分钟分别约 854/1,737/3,421 次交易,总收益约 −59%/−88%/−98%;5 分钟约 11,000 次后几乎损失全部。

关键结果

原文结果与口径
核对项结果意味着什么
扣费后总收益为正0/55只适用于作者测试的规则家族和样本,不能概括均线所有用途。
毛收益也为负37/55多数配置问题并不只是手续费贵。
网格内胜率约 14%—29%低胜率本身不是失败证明,关键是少数大盈利不足以支付亏损和费用。

怎么理解?

应把它看作一个信号增量检验:多画几条均线并没有引入新的信息源,反而可能把同一价格噪声重复投票。交易周期缩短,使每段行情能支付的收益与固定往返费之间的比例恶化。 但文中“冷却期只能慢一点亏”比证据走得更远,作者并未直接测试冷却时间,而更严格的确认规则并不等价于时间冷却。真正严谨的结论是已测试网格不值得直接部署,不是任何降频、持仓或风险预算改造都无效。

最大限制

完整格子、仓位复利约定和代码未核验;未建模资金费与额外冲击。文章标注 8 月 1 日而目录收录在 7 月,保留两种日期,不把发布时间倒改。

复现与研究价值

复现时先固定信号、下根成交和仓位,再同时报告算术单笔收益与复利净值;若测试冷却期,把它当新假设,用新的时间段验证而不是继续在原网格选优。

原文与核查

公开全文已读;图表依正文说明解读,未独立重跑。

原始文章 ↗

推荐 75/100 · 问题 24/30 · 证据 21/30 · 方法 21/25 · 复现 9/15

负面结果和成本分解具体,但公开实现与部分泛化判断有局限。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 论文导读

比特币“美股隔夜收益”预测 VIX:关键是时间切分,而不是币价全天涨跌

Bitcoin's Overnight Returns Forecast the VIX

Ali H. Askar;原论文 Ming Gu / Juan Lin / Siyi Liu

一句话先讲结论

把比特币按美股交易时段切开,2018—2023 年样本里,隔夜收益对随后日间 VIX 对数变化的系数为 −0.262,t 值 −2.49;交易时段那段收益加入后却不显著。导读报告相关模型交易 VIXY 扣费后信息比率 0.986,但基准是长期持有 VIXY,并不能直接理解为接近 1 的纯预测 Alpha。

它到底在问什么?

股票市场关闭时仍交易的比特币,是否提前吸收了下一次美股开盘才反映的情绪信息?全天收益会不会把有用与无用时段混在一起?

作者具体怎么做?

  1. 五分钟 BTC 数据按美国市场时钟分段,研究期为 2018—2023 年。全文样本隔夜均值约 +0.093%,交易时段约 −0.029%。
  2. 以 Google 搜索和活跃地址相对过去月均值衡量关注度;高低关注组隔夜收益差约 1.133% 与 0.987%,t 值约 2,但该排序关系不足以单独证明散户因果机制。
  3. 回归控制标普期货收益、隔夜 VIX、VIX 滞后项、节假日和 FOMC;隔夜 BTC 系数约 −0.262,加入控制后约 −0.255。
  4. HAR 结合 VIX 日、周、月记忆与 BTC 分段信号进行样本外预测;交易演示使用 VIXY/VXX、每交易美元 9.7 bp 摩擦,按预测方向多空。

关键结果

原文结果与口径
核对项结果意味着什么
隔夜预测系数−0.262,t=−2.49回归方向性证据,不是 BTC 涨 1% 就保证 VIX 跌固定点数。
VIXY 信息比率0.986相对买入持有 VIXY 的主动收益比率,不等于对现金的夏普。
VXX 替代工具0.894有跨工具检验,但两者都受波动率期货结构影响。

怎么理解?

最有启发的是信息时钟:24 小时交易资产的日线切点可以把先导信息与随后反转相互抵消。与其盲目加更多资产,不如先保证每条数据在目标决策时点已经可见。 需要拆掉的叙述是“比特币导致 VIX”。即使控制股指期货,仍可能是共同新闻在市场间不同步反映。VIXY 买入持有受期货期限结构影响,偏空策略超越它不稀奇;应与静态空头、期限结构和风险匹配基准比较,才知道 BTC 提供多少增量。

最大限制

原文详细数字依据完整导读,期刊全文及 SSRN 下载未取得;样本外包含疫情,后疫情子期很短。夏令时、交易日对齐、做空借券与跳空风险尚未独立审计。

复现与研究价值

冻结隔夜定义和 HAR 规格,用未参与选择的后续年份比较 BTC 隔夜、股指期货和静态短波动基准;先验证预测误差增量,再做相同尾部风险预算的净收益比较。

原文与核查

导读完整解析,出版书目核对;未逐表审计原论文。

原始文章 ↗

原论文 DOI

早期 SSRN 版本

推荐 81/100(暂定) · 问题 27/30 · 证据 22/30 · 方法 23/25 · 复现 9/15

时间切分与风险基准问题值得研究,显著性和经济收益外推有限。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

先换采样时钟再换指标:2,021种新K线的胜出者,仍缺公开公式

I Invented 2021 Candle Types to Find the One Holy Grail

Stuart Farmer

一句话先讲结论

作者用大模型生成3,600种采样方案,去重后测试2,021种,179种盈利且击败对应时间K线;但快采样优势加入费用就消失,前三名主要帮助均值回归而非趋势。标题的夏普提升不能直接当作可复现结果:冠军公式与代码收费,文中留出测试仅称第一名继续领先,没有公开完整数值口径。

它到底在问什么?

日内策略效果差,到底是指标不行,还是固定一分钟、十五分钟把有用交易活动切碎?文章把优化对象从指标转向决定何时收盘一根K线的规则。

作者具体怎么做?

  1. 从一分钟OHLCV出发,由大模型生成60个家族、每族60个方案,允许自由重采样;1,579个重复项剔除,留下2,021个实际方案。
  2. 在2020—2025年八个外汇品种上跑布林均值回归、RSI反转、唐奇安突破和均线交叉,每方案获得32条策略—资产曲线。
  3. 按输出K线根数匹配时间采样基准,用夏普增量排序,再检查换手、费用、随机时钟以及更多交易规则。
  4. 快K线税前优势最强但费用后失效,较慢冠军集中在反转规则;作者称留出集第二、第三名不稳,第一名仍领先。

关键结果

原文结果与口径
核对项结果意味着什么
搜索规模2,021个去重方案不能把获胜方案当作事前单次假设。
初筛胜出179个盈利并击败时间基准,不等于经多重检验仍显著。
风险口径仅收盘到收盘曲线作者明示未展示持仓中的回撤。

怎么理解?

最有意思的是收益形态发生选择:采样规则可能有意等待价格走到某种局部状态才结束K线,于是下一根出现机械反转。这不一定是假信号,但必须证明收盘时点完全因果、触发后真实可成交。如果采样实现回看未来来合并K线,再漂亮的反转都没有交易意义。 根数匹配是有价值的控制,却不是完整公平实验。指标参数按根数固定,意味着事件时钟同时改变观察频率、暴露和换手。更干净的归因应把美元K线、成交量K线和随机时钟都列入,同样约束交易次数与风险。文章关于传统K线历史及“此后没有进展”的表述也过强,不能代替事件采样文献综述。

最大限制

具体冠军公式未公开、费用数值和留出分割未完整列出;同时搜索2,021方案后继续增添指标与筛选条件,存在反复看数据的选择偏差。标题+1.2夏普缺少可核验的完整表格,不能直接引用作业绩承诺。

复现与研究价值

先复现公开可定义的时间、成交量、金额和随机K线,逐笔检查K线结束时间与下一笔执行;冻结一组参数、用后续年份和另一外汇数据源验证净收益,再考虑购买复杂公式。此处未执行这些实验。

原文与核查

已解析公开文章全文;冠军实现与图表底层数据未取得。

原始文章 ↗

推荐 67/100(暂定) · 问题 25/30 · 证据 16/30 · 方法 21/25 · 复现 5/15

研究问题新鲜,采样基准有改进;关键公式和完整样本外证据不公开。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 数据工具说明

宏观事件日历真正有用的是时点骨架,不是“事件越多越赚钱”

A Database of Historical Macroeconomic Events

Concretum Research

一句话先讲结论

Concretum 开放宏观事件 CSV,示例中标普 500 自 1990 年以来日均收益约 4.8 个基点,五项以上宏观事件同日出现时超过 30 个基点;但后一组只有 15 天。这篇最值得拿走的是可合并的事件日期和对重建发布时间的提醒,不是一条已经验证的“买入密集发布日”策略。

它到底在问什么?

研究策略在 CPI、非农、FOMC 等日子的表现,需要一个一致的历史事件表,而网页日历往往很难直接并入回测。

作者具体怎么做?

  1. 可选择 FOMC、CPI、NFP、PCE、GDP、ISM 等事件及日期区间,导出 long 格式的一行一事件,或 wide 格式的一行一交易日、每类事件一列 0/1。
  2. 数据包含未来预定日期。可选的 assumed_time_et 按惯常美国发布时间重建,默认关闭,作者明确不把它当核实后的真实时间戳。
  3. 示例把 wide 日历连接到标普 500 总收益指数,从 1990 年开始计算各类事件日平均收益,以约 4.8 个基点的全样本均值为基准。
  4. 再按同日事件数量分组,信息更密集的组平均收益更高;五项及以上组超过 30 个基点,但仅有 15 个观测,作者没有据此主张因果或可交易规则。

关键结果

原文结果与口径
核对项结果意味着什么
全样本日均收益约 4.8 bp标普总收益的无条件均值,是描述性比较基准。
五项以上事件日超过 30 bp,n=15极小样本条件均值,远不足以稳定估计尾部或置信区间。
意外值和初值未包含不能直接用此表测试经济超预期的价格影响。

怎么理解?

它的工程价值高于示例收益:维护稳定事件标识和日期,可以让不同策略使用同一信息环境标签,避免每名研究员手工录出不同日历。尤其是默认不补日内时间,体现了“不知道”比伪精确更可靠。 解释收益时要避免重复计数:同一天同时含 CPI 和其他事件,多个事件组可能都收到同一笔收益。所谓密集事件溢价还可能混有星期、月底和市场状态效应。工具解决的是数据连接,不会自动解决识别问题。

最大限制

未下载核对整个 CSV 与官方历史公告;惯例时间可能随年份调整、停摆或会议安排改变。没有预期值、初值及修订快照,示例亦未提供稳健性检验。

复现与研究价值

先抽样对照官方发布记录并区分预告日期与实际日期;事件研究按日聚类,控制星期/月末,报告非重叠事件组和剔除极少样本后的结果。日内应用必须另建真实发布时间。

原文与核查

公开工具说明及完整示例已读;未审计导出数据。

原始文章 ↗

推荐 83/100 · 问题 27/30 · 证据 22/30 · 方法 22/25 · 复现 12/15

日历与时点警告直接可用,示例收益不构成策略证据。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

同一根 K 线先止盈还是先止损:82.54% 的乐观盈利配置过不了压力测试

Does Your Backtest Survive the Adverse Same-Bar Fill? A 48.8 Million-Pair Stress Test

Rulyfi

一句话先讲结论

对 4,882.5 万个相同配置,只把同根 K 线触及止盈止损时的优先次序由止盈改成止损,76.13% 的总收益发生变化;在原先盈利且交易数达标的配置中,82.54% 变成不盈利。这不是证明它们实盘必亏,而是说明小时 OHLC 不够判定这些策略是否赚钱。

它到底在问什么?

OHLC 告诉你高低点都出现过,却没告诉你哪一个先出现;如果策略盈利依赖这个缺失的信息,怎样分配更细数据的验证资源?

作者具体怎么做?

  1. 测试 Binance 五种 USDT 永续的独立多头与空头,2020-11-13 至 2026-07-29 共 50,000 小时;20 种指标×14 周期产生 280 种变化,再两两组合并配 125 组止盈、止损和存续期。
  2. 冻结行情、方向、费用、滑点、资金费及四折前推设置。每个配置跑两次,只切换同 bar 出场次序,按不可变配置键一一配对,总计 9,765 万次回测。
  3. 费用设 taker 0.04%、滑点 0.01%,资金费按 bar 对齐纳入。交易数与资金费贡献在配对中不变;SOL 缺少部分预热,作者单独提示。
  4. 以总收益为正且两模式均至少 30 笔为筛选:802.55 万个乐观盈利项中仅 140.09 万两边都盈利,662.46 万只在乐观模式盈利。

关键结果

原文结果与口径
核对项结果意味着什么
总收益受影响76.13%参数网格占比,不是独立策略在真实世界失败的概率。
受影响配置的中位变化−13.50 pct总收益差,非年化;胜率中位下降 1.94 pct,回撤加深 5.80 pct。
原盈利项仍盈利17.46%其余应优先补充日内路径,而非立即断言均不可交易。

怎么理解?

最好的设计不是数字巨大,而是把实验单位从排行榜名次换成同一配置:成本、资金费和交易次数不变,才能把变化归因于路径假设。几千万参数高度相关,不会让统计证据自动变成几千万独立样本。 实际应用应采用三级决策:两边都通过才进入下一道检验,只乐观通过就买更细数据,两边都失败则在当前规则下淘汰。高频、窄止盈止损更敏感,是验证优先级线索;它并未单独识别频率的因果作用。

最大限制

厂商自有引擎与扫描结果未独立审计;SL-first 不能模拟跳空、排队和部分成交。即使更低周期也仍可能存在 bar 内路径歧义,且通过本检验不代表已解决多重检验或样本外过拟合。

复现与研究价值

给现有回测输出加入执行假设键,同一候选保留两套净值;先在受影响且经济价值较高的候选上回放逐笔数据,再校准真实执行。不要用重新排序后的 top 榜配对。

原文与核查

公开全文、完整参数与配对表已读,未运行扫描。

原始文章 ↗

推荐 89/100 · 问题 30/30 · 证据 24/30 · 方法 24/25 · 复现 11/15

可直接转成回测质量闸门,控制变量清楚;大规模厂商结果仍需独立验证。

返回全年目录 ↑

Quantocracy / Word 标准 · 材料受限,不计完整解析 / 论文导读

用标普超卖信号择时空波动率,比反过来读 VIX 更有用吗?

Chicken and Egg: Use the SPX to Time the VIX, Not Vice Versa

Ali H. Askar;原研究 Robert Hanna

一句话先讲结论

公开部分报告:2007—2023 年无过滤空一份 VX 累计赚 213.52 点、最大回撤 68.86 点;只在标普 RSI(2)≤20 时空 VX,收益 178.6 点、回撤降到 21.04 点。它提示标普短期价格状态可能帮助筛选空波动率时机,但点数收益不等于投资组合年化回报,更不能忽略保证金和危机跳升。

它到底在问什么?

研究通常用 VIX 判断股票;把方向反过来,用股票的超买超卖状态预测波动率期货,是否更合适?

作者具体怎么做?

  1. 长期部分对标普使用一年涨跌、200 日均线和 50/200 日交叉过滤,再构造相反方向的 VIX 过滤;公开报告中 VIX 长期过滤未改善股票收益风险比。
  2. 短期用 RSI(2) 分桶:标普超卖后次日胜率约 57.66%、利润因子 1.41;改用 VIX 超卖读数预测标普,则约 55.51% 与 1.14,接近无过滤的 54.79% 与 1.11。
  3. VX 连续合约在到期周前一周二换月,比较无过滤空头与只在标普/VIX 各 RSI 桶内持有空头。
  4. 标普超卖过滤的点数收益/最大回撤为 178.6/21.04,恢复因子约 8.49;无过滤为 213.52/68.86,约 3.1。原 SSRN 摘要确认还包含其他 RSI 周期、高低点与示例模型。

关键结果

原文结果与口径
核对项结果意味着什么
过滤后点数收益178.6 vs 213.52收益略少,同时在场时间变化;不是等风险比较。
最大点数回撤21.04 vs 68.86风险下降明显,但未反映保证金占用与危机流动性。
恢复因子8.49 vs 约3.1净利润除最大回撤,对样本路径高度敏感。

怎么理解?

它把一个有用问题具体化了:不是预测市场方向越准越好,而是寻找更适合被预测的交易对象。空波动率的条件收益可能比股票下一天涨跌更容易分层,但承担的是不同风险。 导读把 VIX 说成只能被动反应、不能包含先行信息,因果语气过强。期权价格本来含预期风险和风险溢价;一组技术指标预测效果的差异,不足以证明信息永远从股票单向传到期权。连续合约的长期下移也不能不经资金和换月口径就转化为可领取的收益。

最大限制

导读后半仍在订阅墙;已定位公开原研究与 IFTA 期刊版本,但尚未完整逐页读取。可见数据属于条件回测,仓位、成本、全部参数敏感性和最终模型未核全,因此保留部分解析状态。

复现与研究价值

优先用原论文完整交易规则建立固定合约名义与风险目标两套净值,对比空 VX 基准、期限结构过滤和标普 RSI;单列 2008、2018、2020 危机损失与保证金需求。

原文与核查

公开部分已深入解析,付费后文未读;原论文摘要与出版地址已定位。

原始文章 ↗

Robert Hanna 原研究(2024)

IFTA Journal 2025 原文版本

推荐 73/100(暂定) · 问题 26/30 · 证据 18/30 · 方法 21/25 · 复现 8/15

对照角度有价值,但全文和执行风险核验尚不完整。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 工作论文

不要只给策略一个分数,但“熊市机器学习更好”在这里是事后解释,不是择时模型

GAMLSS/ZAGA: Conditional IR* Distribution For Trading Strategies

Krzysztof Ozimek

一句话先讲结论

作者将标普 2002—2025 年分成 146 个前推测试窗:SVM 策略的调整信息比率为零的窗口占47.9%,买入持有为26.7%。进一步拟合条件分布后,SVM在低动量状态占优、强牛市则买入持有更好;但这里的“状态”用测试窗内部已经实现的涨跌和波动定义,因此不能直接拿来决定下一期选哪种策略。

它到底在问什么?

两个策略的长期平均分数可能相近,失败频率、成绩离散度与状态依赖却不同;能否评价整个分布而非只排一个夏普?

作者具体怎么做?

  1. 训练160个交易日、测试40日、每次前移40日;特征和归一化只用训练数据,输出多/空/现金。
  2. 每个测试窗形成IR*,两策略合并292行;用含零点质量的Gamma混合分布,分别解释位置、尺度与零概率。
  3. 解释变量是同一测试窗的已实现波动和累计涨跌,不是窗开始前已知状态;因此当前用途是归因和诊断。
  4. 模型在六个波动/动量配对点比较分布,报告低动量下主动策略相对较好,高动量下买入持有占优;主动策略多数状态的指标方差更大。

关键结果

原文结果与口径
核对项结果意味着什么
IR*=0的窗口47.9% vs26.7%是自定义指标零质量,不应直接称亏损概率或胜率。
独立测试窗146×40日相邻训练窗重叠,两个策略同窗也相关,292行不等于292独立实验。
全部交易成本未计入比较是毛结果,不支持可部署策略排序。

怎么理解?

从单点升级到分布是正确方向,但应先问分布里的随机变量是否保留自己关心的经济信息。把所有负收益折叠成零,既能形成适合ZAGA的形状,也会让严重尾部损失在指标上消失;最好同时展示原始损益和回撤分布。 还有两层推断不能跳过:事后状态解释不是实时预测;固定拟合参数生成大量模拟,也不能代替对参数估计和模型选择不确定性的重估。论文称模拟比例为p值,但若未在原假设下重新校准,不能直接按经典假设检验读其0或1。

最大限制

单一指数、单类模型、未扣成本;同窗状态与指标机械相关。分位数配对可能构成历史上少见的联合状态,近完全分离导致部分统计量退化;PDF截图工具失败,表格按完整文字读取。

复现与研究价值

先把评估层用于已有策略诊断,另设滚动训练的下一期状态预测层;比较真实损益分布与IR*结果,使用配对区块重采样并在每轮重新拟合分布,检验结论是否稳健。

原文与核查

作者说明及arXiv论文正文、结果、结论完整读取,未重跑R代码。

原始文章 ↗

原论文全文(arXiv)

版本与摘要

推荐 82/100 · 问题 26/30 · 证据 23/30 · 方法 22/25 · 复现 11/15

条件分布视角有用,指标截断与事后状态要求明确使用边界。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

给炼油策略加 Carry,价值不只分散:小账户更需要一个不爱交易的信号

Part (3/3) - Refiner Trade: A Second Signal and the Case for Trading Less

Beyond Passive Investing

一句话先讲结论

在裂解价差动量之外加入近月减次月的 Carry,5 万美元账户从每日追仓的净夏普约 0.6,改善到 43% Carry、1% 无交易区下的 1.11,佣金约降至原来的四分之一。亮点是第二信号让组合更少交易,而不只是预测更准;但这些最优权重仍取自历史表面,不能因费用已知就免除样本外检验。

它到底在问什么?

弱一些但更慢、更便宜的信号,是否能在实际账户里比毛收益最好的组合更有价值?

作者具体怎么做?

  1. 将 Carry 水平按截至当时的扩展历史做 z-score,截断 ±2 并映射到 ±1;与动量分数做凸组合,沿用 2% 目标波动及能源 ETF 对冲。
  2. 十分位中最低 Carry 组随后季度约 −2%,最高超过 +12%;Carry 自身动量更弱且与水平相关约 0.7,故不作为第三个独立信号。
  3. Carry 与价格动量分数相关约 0.25;无摩擦最优 Carry 比例约三分之一,但 Carry 越多,换手越低。文中某处称每年 trades,与后文实际订单数口径不同,不混作统一成交次数。
  4. 5 万美元账户同时扫描权重和带宽,较好区间为 Carry 三分之一至一半、带宽约 0.5%—1%;10 万美元展示净夏普 1.20、年化约 2.3%、波动 1.9%、最大回撤 3.2%。

关键结果

原文结果与口径
核对项结果意味着什么
5万美元净夏普约0.6→1.11同时改变信号权重与执行带宽,不能全部归因于 Carry 预测力。
10万美元年化/波动2.3% / 1.9%低风险预算的作者结果,不是高收益套利。
未计股票借贷成本明确未计所谓净收益仍非全部成本后的实盘回报。

怎么理解?

这是成本感知组合的直观例子:互补不止表现为收益相关低,也表现为信号生命周期不同。较慢信号可以抵消快信号的小幅调仓,让账户在同一笔固定费用面前更有耐心。 但正文把调参峰值宽解释为“不是拟合”,仍不够。Carry 权重、无交易区和回测路径共同决定收益,参数平台只能降低尖峰疑虑,不能替代未见数据。扩展标准化亦可能有长期结构变化;Carry 季节性与期货换月规则需要单独处理。

最大限制

继承第二篇收盘信号同收盘成交时序疑问;借券、价差、冲击及现金收益未充分说明。季度收益分组重叠、共同行业风险与历史幸存篮子仍可能夸大稳定性。

复现与研究价值

在下一可执行价格上比较动量、Carry、组合三者;权重和带宽在训练期固定,测试期不按账户结果回调。报告净收益中信号分散、订单减少和风险敞口三项贡献。

原文与核查

全文及两篇前序均已读,未独立回测。

原始文章 ↗

第一篇:产业机制

第二篇:账户成本

推荐 83/100 · 问题 29/30 · 证据 22/30 · 方法 23/25 · 复现 9/15

信号生命周期与固定成本结合有价值,但联合参数和执行验证不足。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

先改入场还是出场?胜率看止盈止损,样本外表现却主要取决于两者配合

What Should You Change First in a Crypto Backtest? 99.75 Million Tests

Rulyfi

一句话先讲结论

9,975 万个加密回测中,胜率在十个市场方向组全部更受退出规则影响,最大回撤全部更受入场规则影响;但所谓样本外评分的变化,平衡子样本里中位90.8%来自入场×出场交互。不能单独选最佳入场和最佳出场再拼起来,也不能把提高胜率当提高收益。

它到底在问什么?

研究预算应花在换指标、微调周期,还是改止损?先要明确希望改变的是哪个结果,而不是不停追求每项都更好。

作者具体怎么做?

  1. 五种永续、长短分开十组,2021-05-28至2026-07-21小时数据。400种指标周期变化两两配对成79,800入场,乘125种止盈止损存续期,共9,975万格。
  2. 主比较只用76,000种跨指标家族配对;入场和出场敏感度分别除以该组全部结果的IQR,比值<0.8判入场主导、>1.25判出场主导。
  3. 胜率出场/入场敏感度中位约20.8倍,最大回撤和交易数则十组全由入场主导。更换指标家族远大于同指标周期前进一步,两者不应都混叫调入场。
  4. 完整125退出均有效的入场子集上做主效应/交互分解;OOS log-rate proxy交互占79.5%—95.7%,中位90.8%。该分数不是OOS账户收益。

关键结果

原文结果与口径
核对项结果意味着什么
胜率:退出主导10/10组只说明能改变胜率,不说明改善经济价值。
回撤:入场主导10/10组在这个特定参数覆盖宽度下成立,不是普遍因果定律。
OOS交互份额中位90.8%评分方差分解,不是90.8%的收益来自交互。

怎么理解?

最大的用途是给研究流程排序:先确认目标与结构,再细调周期。高维网格常让人误以为每一个参数同等重要,配对差异和交互图能识别哪些动作只是浪费计算。 但敏感度取决于研究者给每个轴多宽的范围。把入场从RSI换成SMA,与止损只挪一档,并非同等干预。主扫描还采用同bar先止盈,保守重放没有重建OOS折,因此90.8%的交互不能声称已通过成交稳健性验证。

最大限制

五币和十方向组仍高度相关;OOS指标为代理值。主扫描有乐观成交,资金费虽纳入,完整实现未独立审计。结果只提供搜索地图,不认证任何盈利策略。

复现与研究价值

在自有策略的小网格中复刻IQR与单变量配对,最后整格验证;用真实OOS净收益替代代理值,并在保守成交下重新计算交互而非只验证胜率。

原文与核查

全文所有表和限制已读,未重跑扫描。

原始文章 ↗

推荐 85/100 · 问题 28/30 · 证据 23/30 · 方法 24/25 · 复现 10/15

结果目标与参数交互拆分实用,设计依赖和OOS口径需警惕。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

193 个 SPY 周三并不足以证明 0DTE“稳定贵13%”:分布假设和尾部更重要

Are 0DTE Straddles Overpriced? We Tested 193 SPY Sessions (2022-2026)

Tomasz Dobrowolski / FlashAlpha

一句话先讲结论

作者取 193 个 SPY 周三,10 点隐含一倍标准差区间覆盖收盘 71.0%,高于正态基准 68.3%;实际绝对涨跌/隐含幅度的中位数为 0.589,低于正态的 0.674。但这只是分布覆盖比较,不是期权净收益;而正文“超出区间25.9%”与“区间内71.0%”不互补,必须先核对数据再接受稳定溢价结论。

它到底在问什么?

到期日跨式收取的权利金是否系统性超过随后实现波动?要区分隐含标准差、跨式盈亏平衡点和卖方实际收益。

作者具体怎么做?

  1. 抽取 2022-07-06 至 2026-04-01 每个有完整数据的周三,193 场;用 10:00 ET 平值跨式报价推算隐含幅度,对照当日 16:00 中间价相对 10 点现价的变动。
  2. 正文中位隐含幅度为现价 0.72%,中位绝对实际变动为 0.37%;另一个比率 0.589 是逐日比值的中位数,不能直接由两个中位数相除替代。
  3. 逐年覆盖率 2022下半年/2023/2024/2025 约69.2%/69.2%/70.0%/71.2%,2026一季度84.6%但只有13场。
  4. 报价用 mid,未计费用滑点;只检验终点不检验日内路径。原文提供 CSV 和付费 API 重播入口,本次未使用账户或购买数据。

关键结果

原文结果与口径
核对项结果意味着什么
区间覆盖71.0% vs 68.3%差约2.7个百分点,193场下不能只看点估计便宣布稳定显著。
绝对幅度比率中位数0.589 vs 0.674约低13%,不是权利金利润率或卖方年化收益。
最大披露尾部8.72% vs 3.51%实际幅度约2.5倍隐含,揭示卖方需要承担非线性尾部。

怎么理解?

文章比只晒胜率好,至少给了明确时点和尾部案例;但它把“真实分布与正态基准不同”直接叫过度定价,逻辑仍缺一环。定价还包含风险补偿,跨式价格对应绝对偏移期望而不直接等于标准差。 正文内外覆盖率相加仅96.9%,后面又写约74%,这种口径冲突不能省略。买保护翼能限制最坏损失,却同时支付保险成本,不能据此断言铁蝶和铁鹰保留同样优势。要推荐交易,必须用真实报价构造每笔可执行损益。

最大限制

周三选择、样本缺失条件、覆盖率不一致和正态映射需核验;未下载逐日CSV,未证实隐含幅度转换。无滑点、费用、风险预算与完整损益分布,不支持裸卖或定义风险组合获利断言。

复现与研究价值

先复核193行的inside/outside互补性,再按实际卖价买价回放跨式及保护翼组合;报告尾部损失、条件收益与置信区间,而非只对比覆盖率。

原文与核查

全文数字表与局限已读,发现一致性问题已保留,尚未审计逐日CSV。

原始文章 ↗

推荐 73/100(暂定) · 问题 25/30 · 证据 17/30 · 方法 20/25 · 复现 11/15

时点和样本清楚、可作为核验练习,口径冲突使稳定溢价结论不可靠。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

RSI 70/30 是价格状态标签,不能自动变成反转预测

Is RSI Overbought a Sell Signal? We Tested 70/30

The Refutation

一句话先讲结论

四种加密资产、六个周期上,RSI(14) 穿越 70/30 后的短期平均收益大多接近零;4 小时“超卖”后,未来 10/20 根反而约跌 1.06%/1.54%。作者的完整交易版本六个留出行情阶段均未通过。证据否定的是固定 70/30 反向交易,不是 RSI 在任何条件下都没有信息。

它到底在问什么?

超买超卖描述过去单边走势,为什么应当意味着接下来反转?文章直接测这个最基础的方向假说。

作者具体怎么做?

  1. BTC、ETH、SOL、XRP 一分钟数据重采样到 5 分钟至 4 小时六档,只记录 RSI(14) 穿入 >70 或 <30 的那根 bar。
  2. 测随后 1、2、3、5、10、20 根的原始前瞻收益;信号可聚集,持有窗口重叠,作者因此不以单个 t 值作为证据。
  3. 快速周期样本数较多,平均移动约 ±0.01%,5 分钟近八千信号的多数格子约零;较慢 4 小时超卖后继续下跌而非反弹。
  4. 交易版本另用 BTC/ETH/BNB,买超卖、空超买,止盈止损在五个行情阶段拟合、留一个测试,轮换六次,所有周期均 0/6 通过。资产菜单前后并不相同。

关键结果

原文结果与口径
核对项结果意味着什么
快速周期前瞻均值约±0.01%多数原始优势不足支付现实往返摩擦。
4小时超卖后10/20根−1.06% / −1.54%提示趋势延续,不可把全表挑一格改成新做空策略。
交易版本留出阶段0/6通过依作者自定门槛;阶段留出不完全等于时间前推。

怎么理解?

优点是先测信号,再让退出规则复杂化。若相对无条件基准没有未来方向增量,就不应把优化止盈止损后的幸运格子归功于 RSI。 但作者“任何退出都无法制造优势”的论断过强:无条件固定期限均值为零,不排除路径条件、波动或状态信息。六阶段留出若训练包含测试期之后的数据,也不是实时可实行的 walk-forward。严谨结论必须限定到测试家族、资产、门槛和回测程序。

最大限制

无完整代码、数据日期和通过阈值;快速样本仍可能相关,跨资产池化会掩盖异质性。未见先验明确、独立验证的状态交互规则。

复现与研究价值

先把同资产同期限基准和重叠窗口聚类做对,固定 RSI 跨越定义,再测试少量事前状态条件;不要从负面表里重新挑一个最漂亮反向格子。

原文与核查

全文与方法脚注已读,未重跑。

原始文章 ↗

推荐 75/100 · 问题 24/30 · 证据 21/30 · 方法 22/25 · 复现 8/15

信号与交易区分有用,但内部验证未完全开放,泛化措辞需收紧。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

MACD 看起来有效,可能是旁边的趋势过滤器在赚钱

MACD: The Indicator Is a Passenger

The Refutation

一句话先讲结论

作者测试 360 项测量、320 个 MACD 变体后,标准交叉系统六个留出阶段全部失败;加入趋势过滤后改善,但在同样高于 200EMA 的时点随机做多,也拿走了几乎全部改善。最有价值的结论不是“MACD 永远无效”,而是组合赚钱时,要证明入场指标比条件随机入场多贡献了什么。

它到底在问什么?

一个包含 MACD、趋势过滤与持仓管理的系统赚钱,怎样分清到底是哪一块在创造收益?

作者具体怎么做?

  1. 作者先写下四项预测,再在主要加密资产多周期测试交叉、柱状图、背离和趋势过滤;只在信号 bar 完成后行动,称已扣现实摩擦并考虑多重试验。
  2. 柱状图拐点在约一年 5 分钟数据有逾 23,000 个测量,六年小时数据约 14,000 个,相对基准增量约零;周线 BTC 仅 16 笔,样本又过少。
  3. 小时看跌背离在全历史一度显著,但在后续 249 日下跌窗口三种资产均亏损,与同样退出的随机空头接近;这是事后精彩单元格未能维持的案例。
  4. 高于 200EMA 的随机多头吸收了多数过滤后改善;内部更复杂状态模型的 MACD 版本六阶段中四阶段盈利,横盘和另一熊市失败,作者仍不接纳。

关键结果

原文结果与口径
核对项结果意味着什么
标准交叉留出通过0/6针对作者网格与验证规则,不等于所有市场 MACD 的数学定理。
内部状态过滤版本4/6盈利盈利阶段不等于通过作者完整验收,也非指标独立贡献。
横盘阶段150笔,单笔−0.33%来自池化交易表,反映过滤器在横盘失效后费用消耗。

怎么理解?

这篇可转成一条很实用的研究规范:每加一项组件都做条件消融。先留住过滤器和退出,只替换入场为随机,再问复杂指标是否优于这个公平对照。否则所谓复杂系统可能只是重复支付交易费用来持有一个简单敞口。 仍需警惕作者把“周期换了符号就不是真实效应”说成普遍规律。短期反转、长期动量完全可能并存;不稳健需要结合经济机制和预设频率判断。内部阈值和状态模型不公开,也使外部无法完全复核其强烈否定语气。

最大限制

测试网格、完整门槛和内部状态过滤器保留在厂商内部;所谓预注册未核实时间戳。阶段轮换可能用到未来时期训练,不是严格实时前推。

复现与研究价值

在自己的市场复制“过滤器+随机入场+相同退出”对照,保留净值、换手和风险匹配;只有增量稳定后才把 MACD 当必要组件,否则直接简化。

原文与核查

全文及所有文字表格已读,未取得内部测试台。

原始文章 ↗

推荐 80/100 · 问题 27/30 · 证据 21/30 · 方法 24/25 · 复现 8/15

条件对照和组件归因很值得借鉴,完整实现透明度不足。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

融资余额创新高不等于卖点:醒目的历史图,只有三个已完成事件

Margin Debt Is at an All-Time High, What Does That Mean?

Allocate Smartly

一句话先讲结论

把融资余额相对 GDP 的一年变化超过 1% 作为信号,历史三个已完成事件后的 12 个月收益分别为 −0.8%、−13.2%、+23.2%。再加“冲高后回落”条件,18 个月年化均值约 −20.1%,图景更悲观;但只有三轮危机附近样本,而且阈值是看过长期数据后选的,远不足以证明可提前定位市场顶部。

它到底在问什么?

市场杠杆处于极端水平,是可执行的择时信号,还是只能说明潜在脆弱性的背景指标?

作者具体怎么做?

  1. 作者先指出 1990 年代初融资/GDP 序列有结构变化,直接比较全部年份的水平容易用后来的尺度改写当时认知。
  2. 第一版事件定义是一年变化超过 1%,已完成历史事件为 2000-01、2007-06、2021-01;分别计算之后 12、18、24 个月收益,超过一年者年化。
  3. 三个事件的 12 个月收益分化很大,几何平均约 +2.0%;18/24 个月年化均值为 −10.0%/−8.1%。
  4. 第二版要求越过 1% 后出现任意下降,信号移到 2000-04、2007-08、2021-04;12/18/24 个月几何平均为 −7.7%/−20.1%/−9.0%。最新信号后尚未完整走完的窗口保留问号。

关键结果

原文结果与口径
核对项结果意味着什么
原始信号后一年−0.8% / −13.2% / +23.2%同一极端条件并不稳定指向下一年下跌。
加回落条件后的18个月几何平均年化 −20.1%三个事件的描述统计,不能当未来预期收益。
已完成独立周期3 次关键有效样本量是事件,不是月度数据行数。

怎么理解?

文章难得之处是没有把更漂亮的第二张表包装成卖出信号。加一条回落条件很容易事后贴近危机起点,但每加一条都在使用已有事件的信息;只有三次事件时,规则微调的自由度可能比证据还大。 对风险管理仍有意义:杠杆加速可作为压力情景的背景变量,例如提高流动性冲击测试强度。但“脆弱性升高”与“未来某月收益为负”是不同命题。前者可帮助设计风险预算,后者需要独立时点和多周期证据。

最大限制

阈值 1% 与“任意回落”未经真正事前冻结;GDP 修订和融资数据发布时间未做 point-in-time 核验。三次事件的长期持有窗口不能支撑精确置信区间或复杂参数。

复现与研究价值

保留原始发布时点和 GDP 历史版本,预先冻结规则;后续只记录新事件,不继续调到贴合旧峰值。将其作为风险分组变量,与趋势、信用和波动指标比较增量。

原文与核查

全文及两张数字表已读,未重新获取融资/GDP 序列。

原始文章 ↗

推荐 75/100 · 问题 23/30 · 证据 20/30 · 方法 22/25 · 复现 10/15

诚实呈现小样本和事后选阈值,适合校准择时直觉而非直接交易。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

同一炼油策略,100 万美元净夏普 1.25,1 万美元却 −1.3:最低佣金改变执行方式

Refiner Trade: From Gross Sharpe to Net

Beyond Passive Investing

一句话先讲结论

沿用毛夏普 1.48 的炼油股策略,每日追踪目标仓位时,100 万美元账户扣佣金后约 1.25,1 万美元却降至 −1.3;加入仓位偏差无交易区后,小账户可回到约 0.4。核心是最低每单佣金惩罚订单数量,而不只是换手金额;但本文“收盘信号同收盘成交没有前视”的说法需要重点质疑。

它到底在问什么?

小资金是否能复制大资金的同一百分比策略?当费用含每单固定下限时,按比例缩小持仓会不会根本改变净收益?

作者具体怎么做?

  1. 作者按每单最低 0.35 美元或每股约 0.0033 美元较高者计费,交易八只炼油股及能源对冲 ETF,整数股处理使小资金离散误差更明显。这里是作者费用假设,不是本解析核实的当前券商报价。
  2. 不设缓冲时,每日紧跟目标,净夏普随账户变小急跌;对 25,000 美元账户约为 0.2,对 10,000 美元约为 −1.3。
  3. 仓位差超过无交易区才调整,小账户较有用区间约净值 1%—1.5%,较大账户可更窄;25,000 美元约改善到 0.9,10,000 美元约 0.4。
  4. 同时扫 EWMA 平滑与无交易区,平滑并未改善,因为减少单量而未充分减少单数,还延迟了短期信息;超过约 50,000 美元时作者报告净夏普约 1—1.25。

关键结果

原文结果与口径
核对项结果意味着什么
每日再平衡:10万美元以上非统一值100万美元约1.25不能把一个账户的净夏普套给所有账户。
1万美元:加无交易区−1.3→约0.4改善来自减少佣金支付频率,未覆盖全部执行成本。
2.5万美元约0.2→0.9仍基于同一历史路径挑选执行设置。

怎么理解?

这篇把成本函数拆得很好。比例费用惩罚成交额,最低佣金惩罚动作次数,适合的降成本控制并不相同;不能机械地把所有信号低通平滑。 然而成本已知不等于执行参数没有过拟合。带宽决定错过哪些行情,最优净夏普仍依赖历史收益路径。更严重的是,若使用最终收盘价算股数和信号,再声称以同一收盘价通过 MOC 成交,通常无法满足真实下单截止时间。必须证明输入在截止前已知,或将成交推迟。

最大限制

所谓净结果仅覆盖声明的佣金与整数股,未完整计入价差、冲击、借券及可能的融资。收盘信号/收盘委托时序未核实,当前结果不能直接称可执行。

复现与研究价值

把信号截点前移到收盘竞价截止前或下一开盘成交,对照净值;执行带宽依据冻结成本模型校准并留样本外。逐笔输出订单数、成交额和每类摩擦,而非只给一条净夏普。

原文与核查

全文及公开评论已读,执行逻辑已审视,未独立重跑。

原始文章 ↗

信号构造原篇

推荐 81/100 · 问题 29/30 · 证据 21/30 · 方法 22/25 · 复现 9/15

最低佣金与平滑的区别重要,但同收盘成交和不完整成本限制很大。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

新闻 AI 的漂亮收益怎样消失:补齐回报、修正并列排序后,次日信号不再成立

The Mechanism Survives, the Magnitude Doesn’t

Tommi Johnsen / Svetlana Shasharina

一句话先讲结论

作者审计约 850 只股票的新闻管线后,发现旧次日收益列只覆盖约半数信号日,周末还有人为零收益;补齐数据并去除十分位并列排序问题后,Claude 次日正负组差从前窗口 +0.200% 到后窗口 −0.108%,置信区间都跨零。仍然显著的是同日 +1.98% 和 +1.20%——新闻与涨跌一起出现,不等于新闻能预测下一天。

它到底在问什么?

早期情绪模型看起来有收益,是模型真正识别了未来信息,还是收益对齐、新闻归属和统计量实现共同制造了幻觉?

作者具体怎么做?

  1. 前窗口 2026-05-15 至 06-28 有 863 个代码、24,329 个股票日;后窗口 06-26 至 07-12 有 846 个代码、每模型 8,454 个股票日,但只含 10 个已实现次日交易日,不能把面板行数当独立时间样本。
  2. 6 月 26 日加入新闻主体相关性门,修正代码歧义与误归属;同时补齐因夜间作业早于次日收盘造成的收益缺失、周末前填和少数串股报价。前后窗口既变时间也变新闻总体,作者不把未复制称为反转。
  3. 旧分位差仅改并列顺序,就能在 +0.098% 与 +0.354% 间变化;改用 sign spread 后,前窗口 Claude/FinBERT/hybrid 为 +0.200%/+0.050%/+0.259%,所有次日区间与两两差都跨零。
  4. 各做 1,000 次置换:同日打乱股票归属破坏公司对应;同股打乱日期破坏时序。真实同日关系超过置换,次日关系则可由股票构成重现,后窗口多数垃圾信号反而更强。

关键结果

原文结果与口径
核对项结果意味着什么
Claude 次日收益差+0.200% / −0.108%前后窗口均不显著,亦非可直接执行的组合收益。
Claude 同日收益差+1.98% / +1.20%关系显著但时序不证明预测;可能是报道已经发生的行情。
FinBERT 中性池正/负漏检1.74:1 / 1.95:1相对 Claude 催化标签的非对称遗漏稳定,不是独立人工真值准确率。

怎么理解?

这篇最值得量化研究员读,不是因为给出新因子,而是把错误测量本身公开成可复用的检查。置换不能只用于显著性检验,还能逼真实样本和假样本通过同一代码,从而发现统计量实现不稳定。 同时要守住作者更正后的边界:小模型门卫确实不对称删除大模型识别的催化,但这不证明它使收益反向。原先所谓混合收益反转被并列排序解释掉;比较全量 Claude 与混合的次日收益,当前根本没有可靠排名。机制标签证据与交易收益证据必须分开。

最大限制

后窗口只有 10 个有效交易日,聚类与重采样实现未独立运行;Claude 仍被用作部分标签参照。尚未证明任何扣费交易价值,不能把同日关系或未来期权研究提案包装成策略。

复现与研究价值

优先按收盘后至开盘前、盘中分别对齐首次新闻与下一可成交价格;按公司和日期聚类,保留置换最大值基准、并列稳健性及开发/验证公司隔离。未来数据只用于确认冻结假设。

原文与核查

55,204字符公开全文分块完整阅读,包含撤回结论与未来计划。

原始文章 ↗

早期提示词实验:须按本篇修订理解

早期 FinBERT 门卫实验

推荐 90/100 · 问题 30/30 · 证据 25/30 · 方法 25/25 · 复现 10/15

主动撤回旧结论、数据修复和双重置换极具审计价值;不是推荐其交易信号。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

抄底陷入回撤的策略,可能只是撞上所有策略都更好做的月份

Investing in "Distressed" TAA Strategies (Redux)

Allocate Smartly

一句话先讲结论

作者追踪 100 多种 TAA,发现接近历史最大回撤的策略之后确实常有更高收益;但当至少一种策略走到历史最大回撤的 70% 时,所有策略下月平均收益也比其他月份高约 50%。因此“困境策略随后反弹”大部分可能是共同市场环境,而不是挑中了更便宜的策略。

它到底在问什么?

买入最近不顺、接近历史最大回撤的策略,是否类似买入被低估资产?真正该比的是它自己其他月份,还是同一时点可选的其他策略?

作者具体怎么做?

  1. 每个策略先用至少 20 年历史形成到当时为止的最大回撤基准,因此最早可选月份从 1990 年开始;截至 2026-04-30 的数据是研究范围,不是用户必须采用的窗口。
  2. 月末设置 1—5 个等权槽位,按当前回撤/历史最大回撤排序,挑达到 50%—100% 门槛且最接近历史极值的策略。
  3. 未被困境策略填满的槽位赚下月平均策略收益,避免把没有信号时的现金差异混成选择能力。比较年化、夏普、最大回撤及同时关注回撤深度和持续期的 UPI。
  4. 低门槛且至少三槽时有小幅改善,严格门槛时信号太少;进一步发现困境会成群出现,而且这些月份非困境策略也表现更好。

关键结果

原文结果与口径
核对项结果意味着什么
共同环境效应下月均值约高50%是所有策略条件均值相对其他月份,不是收益多 50 个百分点。
选择困境策略的增量小幅且局部有限改善集中于较分散、较低门槛区域,未构成强选择证据。
额外切换摩擦未计入个别策略内成本已计,策略间切换成本没有,会进一步压缩增量。

怎么理解?

这是一个非常值得保留的研究纠错:同一策略“差时买比平时买好”,不代表同一天“买它比买别的好”。投资者的问题属于横截面机会成本,前一问题只是在挑市场环境。 历史最大回撤本身也不是价值锚。它随样本长度、策略波动和杠杆变化,一种策略更接近旧极值,可能只是新的风险状态或结构失效。应先判断机制是否还在,再讨论反向配置,不能把越跌越接近旧回撤线当作安全边际。

最大限制

策略数据库存在回溯构建与入库选择问题,未独立审计;使用历史回测策略并不等于当时真实可选菜单。未计策略切换摩擦,网格小幅改善还可能含参数选优。

复现与研究价值

按策略族而非单一变种分组,保留同月平均与风险匹配基准;区分共同冲击、策略特异损失和长期失效,再在可实际获得的策略历史上检验净选择收益。

原文与核查

全文和所有文字计算说明已读,未逐格重建图片网格。

原始文章 ↗

推荐 85/100 · 问题 29/30 · 证据 23/30 · 方法 24/25 · 复现 9/15

识别条件基准错误、直接影响策略配置决策,数据库与成本仍有限制。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 方法说明

RMP 不是赚钱概率:它把单次显著性抬高到整个搜索的幸运冠军门槛

The Random-Max Percentile: Grading Every Backtest Against Its Search's Random Maximum

Rulyfi

一句话先讲结论

RMP把单条调整后证据q转换成Φ(q)的N次方;2万次搜索要过0.95,q需约4.6,而不是常见1.645。作者1.01亿条至少30笔交易结果仅780条超过0.95。它是既有多重检验方法的产品实现,不是新发现的成功概率,也不能挽救错误成交和相关交易。

它到底在问什么?

把不同交易频率策略放在一个DSR总体里,低交易数的高方差夏普会不会抬高所有人的门槛,让忙碌但每笔优势小的策略被压扁?

作者具体怎么做?

  1. RMP=Φ(q)^N,q按偏度峰度校正每笔夏普×√交易数,N为扫描记录的有效试验数;1−RMP与Šidák校正相联系。
  2. 合成实验固定整体t约6,交易数从30至3,000,DSR检出率从100%到0,RMP仍约94%以上;这些结果针对作者特定混合频率零分布,不是DSR普遍失效证明。
  3. 300笔以上、带止盈止损的模拟中,搜索级误报约3.5%—5.8%;无界单侧彩票型收益可能达到名义误报的1.5—2倍。
  4. 7月21日补充署名:最接近金融先例为López de Prado 2022,相同外层Φ(z)^K构造;产品记录N与呈现方式不是统计优先权。

关键结果

原文结果与口径
核对项结果意味着什么
2万次搜索门槛q约4.6以假设零分布和独立试验近似为条件,不是普适阈值。
真实导出通过780/约1.01亿参数行高度相关,不能解释成真实策略成功率。
非有界彩票收益误报约名义1.5—2倍尾部校正不是万能保证,需重采样校准。

怎么理解?

这篇最该提醒的是指标单位。作者界面把每笔夏普乘√252称年化,对交易频率不固定的策略,这不是按日历时间计算的标准年化夏普;读者不能拿它与基金夏普比较。RMP移到证据尺度缓解一类比较问题,却并未修复收益序列的时间依赖。 外层独立试验公式在高度相似网格中可能偏保守,但同一策略内部交易相关又可能偏乐观,两者不能互相抵消当作安全。重复多次设计扫描也应计入研究总预算,不能每次重新把N归零。

最大限制

新指标合成校准与真实导出均由厂商完成,未独立审计;极端分布、小样本、持仓重叠与跨次搜索未完全解决。通过0.95不等于有95%赚钱概率。

复现与研究价值

对候选保留完整按时间收益,使用区块置换校准整个搜索的最大统计量;把单次N扩成研究项目试验台账,并用未见行情验证通过者,而不以哪个指标更好看选择指标。

原文与核查

全文、公式、模拟表及署名更正已读。

原始文章 ↗

推荐 83/100 · 问题 27/30 · 证据 22/30 · 方法 23/25 · 复现 11/15

多重搜索尺度解释有用,署名更正及依赖性边界必须一起读。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 研究综述

五篇研究共同提醒:组合平均收益,会把行业、拥挤与市场状态混在一起

Quantitativo weekly

Quantitativo

一句话先讲结论

本期串联五篇研究,最值得抓住的共同问题是收益究竟在什么条件下成立:行业内选股在压力期更强,拥挤股票贡献了异常组合的大部分收益,而因子 ETF 全样本赢行业 ETF、危机期却可能反过来。它不是五条可以直接叠加的 Alpha,而是一份提醒研究员拆暴露、拆状态、拆尾部的文献地图。

它到底在问什么?

一个总体回测好看,可能来自特定股票、特定时期或某种共同资金行为。怎样把平均表现拆成可解释、可反驳的条件关系,而不是只积累更多策略标题?

作者具体怎么做?

  1. 行业内选股部分转述 Uyar 对 25 个因子和 11 种组合模型的比较,强调简单组合、短仓兴趣和压力期的条件作用;不应把十股浓缩版本视作未经选择的通用配置。
  2. 拥挤部分介绍 Days-ADV,即机构仓位相对日成交量的退出难度,称去掉拥挤股票后 11 条异常不再有正 Alpha;同时强调 2008 与疫情的尾部损失。
  3. 风格部分讨论 312 个特征和由资金追逐风格形成的反馈,随机会计比率作为安慰剂;策略数很多,原始搜索过程和随机对照如何匹配特别重要。
  4. 最后两篇分别用市场状态相似性做行业轮动,以及比较因子和行业 ETF 配置。前者强调下行尾部,后者显示全样本与衰退子样本排名不同,检验的对象并不相同。

关键结果

原文结果与口径
核对项结果意味着什么
拥挤研究范围11 条异常综述称其收益集中于拥挤样本,需原文核查风险控制与持仓披露时滞。
行业轮动回撤54% → 26%综述转述某一策略与基准的历史最大回撤,不是本看板独立复现。
因子/行业 ETF 比较41 个配对全样本因子胜配对共享数据和模型,不是 41 次独立证据;危机期例外重要。

怎么理解?

读这种综述的正确产出应是研究问题清单。比如把一条新因子分成拥挤与不拥挤组,或把配置表现拆成扩张与危机,再判断所谓 Alpha 是否只是承担别人不愿承担的流动性风险。不能看到几篇都说有效,就把它们默认当成独立来源。 也要对简洁叙事保持戒心。“去掉拥挤股后异常消失”可能同时改变规模和流动性;“因子全胜”可能被长扩张期主导;“简单模型胜出”不代表估计永远没用。应回到每篇的对照,问条件变量何时可见、是否事后定义、成本和尾部如何处理。

最大限制

本次完整解析的是公开周综述,不是五篇原论文的联合全文审计。摘要中的样本、控制和参数不足以独立复现,尤其不能根据文中 2021 年旧论文把全部内容列成 2026 年新发表。

复现与研究价值

优先按已有研究瓶颈选择原文:做选股先查行业内信号和拥挤,做配置先查状态与因子/行业对照。为每篇建立样本日期、披露时滞、风险暴露、搜索规模四项核查;本文综述数字不进入策略绩效数据库。

原文与核查

本期公开综述完整解析;五篇底层论文未在本条逐表审计。

原始文章 ↗

推荐 66/100(暂定) · 问题 25/30 · 证据 16/30 · 方法 19/25 · 复现 6/15

主题组织有启发,适合作为文献路线;原论文细节尚未逐篇核验,不宜据摘要下强结论。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

裂解价差领先炼油股:毛夏普 1.48 的产业链信号,不能直接叫市场中性 Alpha

A Cross-Asset Lead-Lag Trade in US Refiners

Beyond Passive Investing

一句话先讲结论

用原油、汽油和馏分油期货构造炼油利润,再预测八家美国炼油商相对能源 ETF 的收益,作者报告毛夏普约 1.48;同一信号交易原油几乎无效,交易裂解价差或股票自身动量仅约 0.5。产业联系比通用趋势解释更有说服力,但结果未扣执行成本,等金额对冲也不自动等于风险中性。

它到底在问什么?

炼油利润先在流动的商品期货中变化,股票投资者会不会反应稍慢,留下跨市场信息传递窗口?

作者具体怎么做?

  1. 使用 Norgate 期货与 Yahoo 股票价格,篮子含 VLO、DINO、DK、CVI、MPC、PSX、PBF、PARR;八家同时可用从 2012 年底开始,更长历史实际使用较少公司。
  2. 股票篮子与能源 ETF 等金额反向持仓,减少行业共同涨跌;用裂解价差的 1、5、10、21 日变化分别按波动率标准化、截断 ±2 后平均。
  3. 信号十分位对应后续股票残差收益约从 −18 bp 到 +42 bp;作者把整体约 +6 bp 的长期炼油股相对能源漂移与梯度区分,不把两者统称择时。
  4. 目标波动率设 2%,毛回撤低于 3%;单只股票检验八家均正,但换成全球炼油 ETF 后效果消失,提示利润区域匹配很重要。

关键结果

原文结果与口径
核对项结果意味着什么
跨资产信号毛夏普约 1.48未扣费,与后续净值不能混称。
自身趋势对照约 0.5支持跨资产增量,但各对照需相同风险和执行口径。
全球炼油ETF替代效果消失区域经济联系有限,不能把美国裂解价差推广到所有炼油公司。

怎么理解?

这篇优点是有可证伪的经济链:利润变化应主要解释受该利润驱动的股票,而不是对什么资产都有效。把共同水平与条件收益梯度分开,也比只展示长期上涨的多空净值更诚实。 但等金额卖出能源 ETF 只消掉名义净敞口,不保证市场、油价或行业 Beta 为零。并购退出也不能被作者一句“幸存偏差较小”豁免:收购溢价、事件时点和退市收益都会改变样本。八家公司分享同一商品冲击,其结果也不是八次独立验证。

最大限制

未独立核验期货拼接、股息、标准化窗口和历史篮子;作者未完整公开代码。正文资金中性措辞强于风险中性证据,毛业绩更未覆盖借券和成交。

复现与研究价值

建立包含并购退出的历史篮子,使用实际当时可知商品价格;比较等金额、滚动行业 Beta 和油价双重对冲。先检验信号在下一可成交时点仍有增量,再讨论容量。

原文与核查

全文、全部文字对照和系列关联已读,未独立回测。

原始文章 ↗

第二篇:执行与成本

第三篇:期限结构信号

推荐 84/100 · 问题 29/30 · 证据 23/30 · 方法 23/25 · 复现 9/15

经济机制和邻近目标反证清楚,风险中性与成本仍待核验。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

同一笔交易,DSR 从0.035变0.919:改变的是搜索参照总体,不是策略变强

How Many Backtests Is Too Many? We Ran the Same Search Twice to Find Out

Rulyfi

一句话先讲结论

一条完全相同的空头交易序列,在A扫描DSR为0.035,在移除部分稀少触发配置的B扫描却为0.919;搜索门槛从1.165降到0.378每笔夏普。变化主要来自总体夏普方差缩小,而非试验数减少。这是统计参照敏感性实验,不是删掉低频策略就发现了真实优势。

它到底在问什么?

多重检验门槛除了取决于试验数量,还受参照策略的频率与方差影响;怎样知道评价变好是策略改善还是标尺变动?

作者具体怎么做?

  1. A含1,176个指标变体、每方向约2,487万结果;B含920个、约1,522万。每格配36种退出,费用0.04%、滑点0.01%,不含永续资金费。
  2. 共同策略的每笔夏普与交易数完全相同,作者可以从A导出预先算出B的N和门槛,再跑B验证算术一致。
  3. 有效试验数减少约28%—33%,数量项仅下降约1%;方差平方根下降约2.13/3.04倍,解释大部分多/空门槛降低。
  4. B中至少30笔、超过门槛的多/空条数为3,798/840,但最强单策略DSR仍约0.925/0.919,均未过0.95。长短组合约0.97只是矩合成,未完整重跑。

关键结果

原文结果与口径
核对项结果意味着什么
相同空头DSR0.035→0.919参照总体变化,不代表交易数据增加或模型进步。
空头门槛1.165→0.378单位为每笔夏普,非标准日历年化。
单策略0.95通过仍无不是A失败、B找到已证实策略的故事。

怎么理解?

最实用的输出是研究收据:不仅保存冠军,还要保存试验数、总体方差、交易次数和门槛。否则同一个DSR看起来权威,实际可能依赖一个任意搜索菜单。 作者强调B按交易次数而非收益删规则,有助于避免最直接的结果筛选,但它仍是看过A后重新设计的实验,不能把A的研究历史消失。尤其不能用“重新跑了一遍”替代真正新行情:算术可预知证明引擎确定性,不证明统计标尺更接近真相。

最大限制

单次约90/10切分且两次边界差约55根;资金费遗漏,乐观同bar执行继承旧扫描。组合DSR为近似矩计算,未验证交易重叠、资本分配和联合尾部。

复现与研究价值

先用不读取收益的规则冻结最低触发频率与网格,保留全部历史搜索预算;对混合频率采用可比证据尺度与区块重采样,同时报告不同合理参照总体下的敏感性。

原文与核查

全文与脚注全部已读,未取得配对导出独立核对。

原始文章 ↗

推荐 84/100 · 问题 28/30 · 证据 23/30 · 方法 23/25 · 复现 10/15

解释统计总体敏感性很有价值,但不能以改总体洗白同一历史结果。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

一亿回测筛出3,130个候选,不等于发现3,130个Alpha

Skill or Luck? We Ran 100 Million Bitcoin Backtests to Show You How to Tell

Rulyfi

一句话先讲结论

约9,988万BTC回测中,33.68万条通过单次PSR>0.95,但加上至少30笔、DSR>0.5及样本外过滤只剩3,130。收益最亮眼的百笔以上策略涨684%,DSR却仅约0.10;所谓长短合并后0.9502也只是矩合成估计,未重跑账户净值,所以这里得到的是候选清单,不是交易系统。

它到底在问什么?

当计算极便宜,漂亮回测几乎必然出现;怎样把“比零好”改成“比同样搜索规模的幸运冠军好”?

作者具体怎么做?

  1. 2020-10-19至2026-07-03约50,000根小时BTC现货;1,443变体两两配对,乘48种退出,再分别建模长短,共99,878,688回测。
  2. 费用0.04%、滑点0.01%;空头直接作用于现货价格序列,未包含真实借券或永续资金费。同bar同时到止盈止损时优先止盈。
  3. 候选要求至少30笔、DSR>0.5、walk-forward效率为正及无负折,3,130条通过;这与更严格DSR>0.95不同,不能把筛后计数称95%显著。
  4. 作者把417多头×2,713空头候选共1,131,321对按矩合成,额外搜索也加进N;仅三个相近组合略过0.95,最好0.9502、共72笔,并无独立合成净值。

关键结果

原文结果与口径
核对项结果意味着什么
基本候选通过3,130/99,878,688不是3,130个独立策略,也不是未来成功概率。
百笔以上冠军+684%,DSR约0.10收益大不等于经搜索修正后证据强。
最佳组合DSR0.9502(估计)依赖非重叠假设与矩重建,未端到端回测。

怎么理解?

文章的教育价值在于把筛选门槛显式写出来,而不是依靠“看上去稳”。但候选几乎集中于30—63笔,说明偏度、峰度与高胜率仍处在很脆弱的小样本区;30不是统计安全线。 组合部分尤其不能只接受“零新增回测就增强证据”的叙述。把交易样本混起来与把两个资金账户组合不是同一对象,净值取决于时间重叠、保证金和权重。作者界面每笔夏普×√252的展示也不是真正日历年化,不能引用约12的组合值宣传业绩。

最大限制

样本外仅两折,未purge/embargo;同bar乐观执行、空头融资遗漏,策略共享同一BTC行情。组合0.9502紧贴阈值且采用近似,难以承受执行和相关性误差。

复现与研究价值

将候选去重成经济策略族,再用保守成交、真实融资和时间对齐账户重跑;冻结规则后等待新数据。搜索记录必须保留失败项及组合次数,不能只保留过门槛名单。

原文与核查

公开全文、网格、公式和全部限制已读,未独立运行。

原始文章 ↗

推荐 81/100 · 问题 27/30 · 证据 22/30 · 方法 22/25 · 复现 10/15

多重检验入门例子清晰,但巨量数字和组合近似容易被过度解读。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 数据方法说明

财务因子的“提前66天”:改公告日期还不够,修订值也不能穿越

Lookahead Bias in Fundamental Backtests: 66 Days, Measured

Tradevo Data

一句话先讲结论

厂商在 2026-07-23 快照的 283,363 条可靠日期记录中,测得年报申报比财年末平均晚 66 天、中位 60 天;若按财年末加入回测,就把数据提前给了模型。但公告日期正确仍不够:18,734 条记录后来被改写超过 0.5%,把最新值贴回旧日期仍会泄漏未来。

它到底在问什么?

真实财务数值为什么也能制造假 Alpha?关键不是数字真假,而是当时何时可见、可见的是哪个版本。

作者具体怎么做?

  1. 完整快照共 313,406 行、5,194 家公司,只有可靠日期行用于66天统计;QA 将可靠滞后限制在120天内,所以90分位90天不代表全体最迟申报时点。
  2. 40家大盘股样本均值仅43天,说明以大盘验证得到的统一延迟不宜外推到小公司。
  3. 检查相同 XBRL tag 后续值变化,超过0.5%标记restated;文中既有会计修订,也有拆股后历史每股指标回溯调整,不能全叫财务造假。
  4. 提供按申报日期审计join及统一延后90天的压力检查;API当日包含语义仍要求处理盘后发布,且只保存原始/最新两值未必覆盖中间每次修订。

关键结果

原文结果与口径
核对项结果意味着什么
可靠行平均/中位滞后66 / 60 天是财年末到10-K日期,不是所有财务事实第一次公开的精确延迟。
大盘样本平均43天样本覆盖会改变时点风险估计。
超过0.5%的后续变动18,734行包括拆股等调整;需要分类判断,不能一概当错误财报。

怎么理解?

这篇最值得落实的是双时间轴:一个时间回答数字属于哪个期间,另一个时间回答研究者何时知道这个版本。审计应逐字段、逐版本做,而不是只给整张财务表一个延后常数。 同时要警惕厂商过强推论。加90天后收益下降,可能是提前信息被修正,也可能是合法早已公布的数据被额外延迟;差额不能全部叫虚假Alpha。原始值与最终值两端也不一定足以重建任意历史日的中间修订。价格数据同样可能受复权和更正影响,并非天然免疫。

最大限制

厂商自测未独立重算,原文日期后有7/23快照更新;可靠行筛选截断尾部,年报申报不必等于所有指标首次披露。商业价格与覆盖是原文信息,本解析不作当前采购推荐。

复现与研究价值

在实际因子管线保存公告接受时间、字段值、版本生效时点和来源文件;使用严格as-of连接并对盘后顺延。比较报告日、真实首次披露日和固定延迟,只把可归因的差异记为前视影响。

原文与核查

正文和审计代码完整阅读,未下载或重算厂商样本。

原始文章 ↗

作者公开样本与方法

推荐 87/100 · 问题 29/30 · 证据 22/30 · 方法 24/25 · 复现 12/15

可直接转为PIT数据验收规则,厂商口径仍需核验。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

把 Claude 调得更像分析师后,相关系数由 +0.24 变 −0.06;但后续审计削弱了收益结论

How We Tried to Teach Claude to Read Like an Analyst, and the Market Said No

Tommi Johnsen / Svetlana Shasharina

一句话先讲结论

在八家公司、六周新闻样本中,放宽 Claude 对催化事件的要求,让它更贴近人工判断,一致率从 36% 提高至 43%,报告的次日相关却从约 +0.24 降至 −0.06。但这不是“严格提示词已经有 Alpha”:作者 7 月 16 日扩大审计后,所有模型的全样本次日关系都不显著,早期分位收益指标也被撤换。

它到底在问什么?

金融新闻模型到底应该最大化专家认同,还是识别决策时点以后尚未计价的信息?两个目标可能并不一致。

作者具体怎么做?

  1. 第一名人工标注者阅读 560 条八家公司标题,第二名阅读 192 条,后者富集前者与 Claude 分歧样本并混入对照;这种抽样不能当一般新闻的随机准确率样本。
  2. 严格 v2 默认大部分新闻中性,只认可具体、可验证、新增催化;v4 放宽合作、战略动作等规则,并降低中性先验锚点。与人工一致率提高,不代表金融目标改善。
  3. 4,296 条文章在同一八股六周窗口同时用两套提示评分,原文报告相关 +0.24 对 −0.06;严格版本单项显著性接近 0.05 边缘。
  4. 更严格变体中,只认可数字的版本相关约 +0.34,却只有 17 个有效信号日;来源白名单版本相关接近零。90% 中性锚版本约 +0.29,随后进入与 80% 锚版本的前瞻并行比较。

关键结果

原文结果与口径
核对项结果意味着什么
与人工一致率36%→43%优化了人工偏好,不等于优化未来收益。
开发样本相关约+0.24→−0.06小型开发面板结果;不能推广为全股票可交易信号。
定量专用提示约+0.34,17个信号日点估计最高却证据最薄,不能按数字大小选冠军。

怎么理解?

最重要的可迁移经验是对齐评估目标。人工可以可靠标注事件和事实,但“明天是否赚钱”还受到预期、发布时间与已实现价格变动影响,不能把专家共识直接当价格真值。 也不能反过来把一次负相关说成“人类错而机器对”。同一窗口里反复修改提示词,本身就是模型选择;六种提示共享样本和大部分规则,并非六次独立验证。后续审计说明,好的故事和局部对照仍可能在全样本或更稳健指标下失去收益支持。

最大限制

本文为开发过程记录,八股新闻密集且样本短;文中 days/ticker-days 表述并不完全一致。后续完整审计纠正收益缺失和分位排序,故旧分位收益幅度不再作为可依赖结果。

复现与研究价值

冻结两套提示、模型版本与新闻首次时间戳,预先确定基于事件而非语气的人工标签;前瞻比较决策后净收益并保留中性池,不能继续用同一开发样本微调到显著。

原文与核查

本文与7/16后续审计全文均已读,结论按版本链解释。

原始文章 ↗

必须连读:7/16后续审计与更正

推荐 82/100 · 问题 28/30 · 证据 20/30 · 方法 24/25 · 复现 10/15

目标错配案例有启发,必须连读后续纠错,不能单独引用早期收益。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 方法复现

三盏风险灯决定 SPY 仓位:8% 年化背后,先看减仓是否真有增量

The Market Regime Filter

Petra Volkova;框架 Gaetano Di Prima / Fabio Baruffa

一句话先讲结论

作者用三项条件给 SPY 配 100%、50% 或 0% 仓位,2008—2026 年回测报告约 8% 年化、18% 最大回撤。规则清楚可重写,但它首先是减仓型风险控制:没有与相同平均仓位或波动率的简单组合比较前,不能把较小回撤全算成识别市场状态的能力。

它到底在问什么?

价格趋势、隐含波动率期限结构和信用风险能否提供互补信息,把“一根均线控制仓位”扩展成多维风险状态?

作者具体怎么做?

  1. 趋势灯:SPY 收盘价高于 200 日简单均线。它描述已有价格方向,不直接判断估值。
  2. 波动率灯:VIX 小于 VIX3M,即近端隐含波动率低于三个月端;信用灯:HYG/IEF 比值的 100 期 z-score 高于 −2。后者是 ETF 相对价格指标,并非直接观测企业债信用利差。
  3. 每天相加三项得分,Score=3 配满仓、Score=2 半仓、Score<2 零仓;演示初始资金 10,000 美元,杠杆 1。
  4. 作者用 Zorro 从头实现并展示约 8% CAGR、18% 回撤,称与原 TASC 结果接近;正文附关键函数与调仓代码,随后评论确认脚本已补上传。

关键结果

原文结果与口径
核对项结果意味着什么
报告年化收益约 8%是复现作者报告,不是本站独立跑出的业绩。
最大回撤约 18%需与同风险水平基准比较,避免把少持股票当择时 Alpha。
仓位规则100% / 50% / 0%离散风险预算,不含空头或动态杠杆。

怎么理解?

这篇可用性在于规则短:每一项通过还是失败都可以追溯,不必先相信一个黑箱状态标签。信用比值有可能补充价格趋势尚未反映的融资压力,但 HYG 和 IEF 对久期也有不同敏感度,因此其含义不只信用。 下一步不是再加第四盏灯,而是拆贡献。趋势、期限结构、信用往往在危机一起变坏,三票可能高度重复。分别删去一项,再与等平均仓位和目标波动率基准比,才能判断多维信息是否真的改善损失尾部。

最大限制

图中业绩未独立重跑,正文没有充分说明现金收益、交易成本、复权以及收盘信号的下一时点成交规则。TASC 标注 2026 年 9 月而博客发表于 7 月,属于原作者版本信息,不改成已经正式逐页核验。

复现与研究价值

按公开代码实现逐日信号,统一下一交易日成交、现金利息和 ETF 总收益;做三项消融、阈值附近测试及平均仓位匹配,不追求单一最优阈值。

原文与核查

正文及全部内嵌核心代码已读,未运行。

原始文章 ↗

共同作者的框架说明

推荐 82/100 · 问题 26/30 · 证据 21/30 · 方法 22/25 · 复现 13/15

核心代码公开、复现门槛低,缺少等风险对照与执行细节。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 论文公告

变量比样本还多时,协方差估计的第一步是选假设,不是直接求逆

Covariance Estimation for Wide Data

Eran Raviv

一句话先讲结论

这篇是作者对已发表于WIREs Computational Statistics的高维协方差综述的介绍:它把因子模型、收缩、阈值、图模型和随机矩阵等方法放进统一框架,核心问题是变量数超过样本数时如何得到可用的矩阵。公告没有比较哪种方法带来最高组合收益,因此它是方法选型入口,不是一个新Alpha结果。

它到底在问什么?

当资产数量多于有效历史观察,样本协方差难以稳定估计甚至不能直接求逆,研究员究竟应该减少维度、收缩噪声,还是对相关结构加限制?

作者具体怎么做?

  1. 作者从变量数超过观察数的宽数据问题出发,梳理统计、计量与机器学习中通常分开讨论的协方差估计路线。
  2. 内容包括因子模型、线性与非线性收缩、阈值估计、分块平均、图模型和随机矩阵理论,尝试统一符号与框架,使不同假设可比较。
  3. 另设部分讨论实际应用中如何保证估计矩阵有效,例如可逆性;这决定矩阵能否安全进入优化器,而不只是拟合样本相关系数。

关键结果

原文结果与口径
核对项结果意味着什么
材料类型期刊综述发表公告已知研究主题与方法目录,不代表本页给出了完整综述的证明和结果。
困难场景变量数大于观察数高维估计需要结构性假设,普通样本矩阵不适合作为无条件默认答案。
收益比较未报告公告未报告任一方法在交易组合中的净收益优势。

怎么理解?

对研究员,这类综述的价值不在于多记几个估计器名称,而在于说清自己的数据适合什么约束。因子模型把共同变化压缩到少数方向;稀疏或图结构则假设很多条件关联可以忽略;收缩是在样本信息与较稳定目标之间折中。不同路线不是可随意互换的“降噪按钮”。这些是方法层面的编辑解释,不是公告中的实验结论。 组合优化还会放大估计问题:看起来误差不大的协方差,求逆后可能给出巨大权重。即使矩阵已经正定可逆,也不意味着预测稳定或组合合理。方法选型必须同时观察权重敏感性、换手与极端敞口,不能把成功求逆当成验证通过。

最大限制

本次阅读的是完整公告,尚未取得和逐章审核综述全文;不评价各方法证明完整性或实际排名。公告没有提供可复现的数据与统一基准,因此此条按公告范围完成解析。

复现与研究价值

将它作为阅读导航:先明确自有数据的资产数、窗口长度、缺失结构与优化目标,再选样本协方差加约束、收缩和因子模型做冻结基准。用真正未来窗口比较风险预测、权重稳定性及成本,不只比较训练期拟合误差。

原文与核查

作者发表公告完整解析;综述全文未取得和逐章审核。

原始文章 ↗

推荐 57/100(暂定) · 问题 22/30 · 证据 12/30 · 方法 18/25 · 复现 5/15

选型导航有价值,但公告不是全文,不能给实证或复现高分。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 产品功能说明

一条策略年化14.5%,QQQ贡献3.1个百分点:收益归因比只看净值多回答了什么

New Feature: Return Contribution Analysis

Allocate Smartly

一句话先讲结论

平台用Optimum3演示收益贡献:策略年化14.5%,其中QQQ贡献约3.1个百分点,交易摩擦拖累约0.7个百分点;另一个策略约10%的平均仓位放在美元指数,但年化贡献只有0.07个百分点。这个工具能指出收益从哪里来,却不能仅凭低收益贡献就判定某资产应被删除。

它到底在问什么?

一条多资产策略赚钱,究竟靠哪个资产、哪个年代和哪类风险?如果某个持仓长期占用资金却几乎不贡献收益,它是无效配置,还是承担了保险作用?

作者具体怎么做?

  1. 先将Optimum3的总年化收益分解到各资产和摩擦,观察最大贡献者QQQ,并按年份下钻,发现其在1990年代中后期贡献突出。
  2. 再汇总到美国股票、国际股票等资产类别,避免资产种类太多时漏掉总体贡献;最高层进一步分成风险偏好与防御类别。
  3. 以Defense First为另一个案例检查美元指数UUP:平均配置约10%,但年化贡献仅0.07个百分点;作者据此讨论用现金或短债替代的可能。

关键结果

原文结果与口径
核对项结果意味着什么
总收益与主要来源14.5%;QQQ 3.1 pct作者平台历史结果与贡献口径,不能把QQQ贡献理解成独立资产年化。
交易摩擦约−0.7 pct/年包含手续费与滑点的估算拖累,具体成本模型仍需核验。
UUP贡献0.07 pct/年长期收益贡献很低,但是否值得删去还要看条件风险和替代资产。

怎么理解?

收益归因把策略研究从一条净值曲线推进到可以提问的账本:优势是否集中在某个资产的大牛市,是否依赖一段特定年代,交易成本是否吃掉了微弱的配置贡献。把低贡献位置找出来,有助于减少不必要的复杂度和换手。 但作者对低收益美元仓位的判断仍需反事实支持。保险在平均收益上常常“不划算”,价值却可能出现在其余持仓同时受损时。要删除它,应比较替代后的组合回撤、尾部和融资需求;不能只按每个资产对平均收益的贡献排序。risk-on/risk-off二分也只是方便展示,长债和黄金并非所有危机中都防御。

最大限制

公开文章未说明复合年化贡献的完整链接算法,也未展示UUP替换后的同口径交易成本与条件尾部比较。平台示例是功能演示,不是独立审计后的收益承诺。

复现与研究价值

自有看板应同时显示收益贡献、风险贡献、尾部窗口贡献及持仓时间,允许按年份下钻;对低贡献资产做明确替代组合的回测,而非直接删去。归因总和必须与最终净值及费用账本一致。

原文与核查

公开功能说明与案例完整阅读;未访问会员账户或重算归因。

原始文章 ↗

推荐 70/100 · 问题 24/30 · 证据 18/30 · 方法 20/25 · 复现 8/15

归因维度和示例具体,删除资产的结论仍需反事实与风险贡献验证。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 产品功能说明

提款率7%未必胜过5%:样本越短,最坏退休路径越可能被漏掉

New Feature: Model Portfolio Withdrawal Rates

Allocate Smartly

一句话先讲结论

平台把安全与永久提款率加入自定义组合,并统一采用30年期限和历史通胀;文章特别提醒,1990年起样本得到7%提款率,不一定优于1970年起样本的5%,因为短样本可能恰好漏掉最差退休起点。这里的5%和7%是解释性假设,不是两条真实策略的实测排名。

它到底在问什么?

平均收益相近的组合,在持续提款时可能有完全不同的耗尽风险;能否用历史最坏路径衡量退休资金承受力,又如何防止不同样本长度造成误导?

作者具体怎么做?

  1. 对自定义组合默认使用30年退休期限和历史通胀,逐年调整名义提款额,区分维持生存与维持实际本金两种目标。
  2. 从样本每个可能季度分别开始模拟,取最坏序列对应的提款率;当后续数据不足30年时,把序列绕回样本开头接续,因此包含人工拼接路径。
  3. 比较工具的普通绩效指标使用共同起始日,但提款率例外,继续使用各自全样本,以免截短数据自动抬高最坏路径结果。

关键结果

原文结果与口径
核对项结果意味着什么
默认分析期限30年功能设定,不是所有投资者的统一规划期限。
两个目标不耗尽 vs 保留实际本金相同收益路径下,永久提款目标通常要求更保守的提款。
尾部拼接样本末尾绕回开头补足模拟期限但并非真实连续历史,必须在结果旁披露。

怎么理解?

提款问题最核心的是收益顺序:早期亏损叠加提款会缩小之后参与反弹的本金,因此年化收益和夏普无法独立决定可持续提款。本文把注意力放在最差起点,是对平均指标的有益补充。短样本看起来更安全,很可能只是没有经历过足够坏的路径。 不过,全部使用各自最长样本也不等于可直接公平排名。不同组合的历史长度、资产可投资性和拼接点依然不同;绕回开头还可能创造不自然的利率与通胀跳变。更稳妥的展示是同时给出共同真实历史、各自全样本和压力情景,而不是用单一提款百分比隐去数据结构。

最大限制

本次只审核公开方法说明,未独立验证平台实现。历史最坏结果不是未来安全保证;模拟季度大量重叠,并不代表同样数量的独立退休经验。具体税费与个体现金流未在本文展开。

复现与研究价值

研究看板应在提款率旁展示有效历史长度、真实完整30年路径数和拼接路径占比,并加入固定收益顺序压力测试;把结果作为风险比较工具,不当作个人提款承诺。以上未执行。

原文与核查

公开功能与方法说明全文已读;未使用会员工具计算。

原始文章 ↗

推荐 70/100 · 问题 23/30 · 证据 17/30 · 方法 21/25 · 复现 9/15

样本长度与路径风险解释清晰,拼接模拟和实现透明度需进一步核验。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 方法说明

交易程序没报错也可能已经失控:行情新鲜度、账户净额与重启对账才是上线底线

How to Build a Reliable Algo Trading Infrastructure

Concretum Research

一句话先讲结论

这篇列举十类实盘基础设施故障:连接显示正常却使用几小时前行情、两个策略对同一股票提交相反订单、重启后漏掉已成交记录,都可能在回测和纸面测试中完全不出现。对AI写出的交易程序,能运行只是开始;必须证明它知道数据是否新鲜、账户究竟持有什么,以及故障后该停止还是恢复。

它到底在问什么?

策略代码正确,为什么实盘仍会错误交易?信号之外的市场时钟、券商状态和账户共同资源,如何被纳入系统的可验证约束?

作者具体怎么做?

  1. 行情层记录每个标的最近更新时间,重连不等于行情恢复;历史请求需处理限速、空响应和缓存,不能静默使用缺失指标。
  2. 调度层基于正式交易日历、交易所时区和校准时钟处理早收盘与夏令时;订单提交、拒绝和取消都必须有明确状态路径。
  3. 账户层显式路由账户并汇总策略需求;每次重启从券商成交与持仓恢复事实,与内部数据库对账后才恢复决策。

关键结果

原文结果与口径
核对项结果意味着什么
连接状态不等于数据有效健康检查需要核查每条数据年龄,而非只看socket是否连接。
纸面交易不覆盖所有实盘校验模拟环境通过不保证真实券商接受同一组订单。
重启条件先对账再决策内部数据库可能漏掉成交或人工交易,不能把进程恢复当作状态恢复。

怎么理解?

这篇可以直接变成上线验收表,但不要停留在一串提醒。每条提醒应对应一个可测试的不变量:过期行情不能开新仓、未知订单状态不能盲目重发、账户不明确不能提交、持仓不一致必须阻断。这样的要求才能约束人写的代码,也能约束AI自动生成的代码。 文章建议某些被拒收盘单用最后时刻市价单补救,实际应谨慎。若订单状态只是延迟而非确定失败,补单可能造成双倍持仓;接近收盘也会放大网络延迟和成交不确定性。回退逻辑应依据幂等标识、成交查询和明确风险上限,而不只是写一个晚几秒触发的定时器。

最大限制

这是经验性清单,没有故障频率或损失统计;券商行为、交易所规则和时间限制可能改变。本解析不将文中操作细节作为已经核实的最新API规范,也未操作任何交易账户。

复现与研究价值

搭建断网、延迟、重复回报、部分成交、重启、早收盘和时区切换的故障注入测试;每个场景记录预期最终持仓和阻断条件。先验证状态恢复,再讨论自动化交易的收益表现。

原文与核查

公开经验文章完整阅读;未验证当前券商规则或执行账户操作。

原始文章 ↗

推荐 83/100 · 问题 29/30 · 证据 18/30 · 方法 24/25 · 复现 12/15

覆盖真实上线隐患,可转换为测试;具体券商细节仍需官方核验。

返回全年目录 ↑

Quantocracy / Word 标准 · 材料受限,不计完整解析 / 独立研究

同一批日内做空候选,改为隔夜做多年化37.1%:省去借券,却接回跳空风险

When Short Sellers Create Overnight Alpha

Concretum Research

一句话先讲结论

作者把上一条日内做空候选改为收盘买入、次日开盘卖出,2012—2026年毛年化37.1%、夏普约1.6、最大回撤约35%;不再需要借券,但每股平均毛利润仅约4.2美分,净收益仍取决于竞价成交和成本。空头回补是解释之一,不是已被识别出的唯一原因。

它到底在问什么?

如果原本的卖空机会因借券昂贵而难执行,能否交易同一股票在另一段时间的风险补偿,用隔夜多头替代日内空头?

作者具体怎么做?

  1. 固定原日内做空候选池,仅改变持有时段与方向,从日内卖空切换为收盘至次日开盘做多。
  2. 用固定10%单股权重控制配置规模,报告毛成本表现,并观察21日平均每日入选数在样本中未低于五只。
  3. 讨论空头回补、隔夜事件风险补偿和高关注股票三种解释;尝试进一步过滤的空间被提出,但尚未提供验证后的新增规则。

关键结果

原文结果与口径
核对项结果意味着什么
毛年化37.1%不含完整交易摩擦,不是实际净盈利。
每股毛利润约4.2美分要按实际双边手续费、竞价冲击与价格分布核算,不能只比较单边佣金。
最大回撤约35%摆脱借券约束后仍有明显隔夜事件风险。

怎么理解?

相邻交易时段的经济结构可能完全不同:日内空头希望回避隔夜不确定性,而愿意接盘的人可能获得补偿。这比把失败策略简单反向更值得研究,因为它真正改变了持有时间和实施约束。不过,同一选股条件的日内跌、隔夜涨,也可能来自关注效应、流动性和Beta,不能只凭叙事归因于空头回补。 尤其需要检查回补究竟发生在什么时候。如果主要买盘在收盘前已经把价格推高,收盘买入未必能赚到这段压力。只有结合竞价订单流、盘后成交和次日开盘才能识别剩余收益;“用MOC/MOO最小化滑点”也不等于可以忽略竞价冲击与订单截止要求。

最大限制

完整筛选表受限,公开作者回顾仍只有概要;未用相关论文冒充私有规则。毛成本回测、因果机制和可成交性未独立审计,固定10%在候选超过十只时的处理也需代码确认。

复现与研究价值

先恢复完整规则与总权重约束,再拆收盘前、竞价、盘后和次日开盘收益;加同Beta、同波动和同流动性对照,报告按价格层的每股净利润及容量,而非只报高年化。

原文与核查

公开方法与结果已读;付费完整筛选表未取得,作者公开回顾未补齐。

原始文章 ↗

推荐 65/100(暂定) · 问题 26/30 · 证据 16/30 · 方法 20/25 · 复现 3/15

交易时段转换有启发,关键选股规则受限且净成本和机制尚未验证。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 获奖公告

2026量化研究奖前三名:动量权重、月内周期与LLM假设发现,但奖项不是收益验证

Quantpedia Awards 2026 – Winners Announcement

Quantpedia / Radovan Vojtko

一句话先讲结论

公告前三名分别研究如何学习历史收益权重、月内动量周期,以及LLM引导的资产定价假设发现;第四、五名涉及重启异常与VIX产品交易。它是一张有用的研究地图,但没有公开统一评审回测或净收益证据,获奖名次不能直接变成策略配置排名。

它到底在问什么?

哪些问题获得本届研究评审关注?读者如何利用公告找到下一步应读的原论文,而不把评奖当成已经完成的实证尽调?

作者具体怎么做?

  1. 第一名Wiedemann与Beckmeyer研究学习过去收益的不同权重;第二名Nathan等研究月内动量周期;第三名Liu等研究LLM辅助金融假设发现。
  2. 第四名Beckmeyer等的Reviving Anomalies和第五名Zarattini等的The Volatility Edge扩展到异常复活和VIX产品交易。
  3. 公告列出奖金、培训和订阅等奖励,并说明第一名将有后续采访;未提供逐项评审分数、样本外净收益或可运行代码。

关键结果

原文结果与口径
核对项结果意味着什么
前三名主题动量权重 / 月内周期 / LLM假设发现可据此安排阅读方向,而非确认三类策略已经可交易。
统一绩效比较未报告公告没有可比较的净收益、风险或显著性表。
研究用途原论文导航获奖本身不能替代对泄漏、成本和复现的审核。

怎么理解?

从主题分布看,传统动量研究没有被AI取代,新的工具更多是在改变如何加权历史信息、提出假设和识别条件。这是编辑观察,不是评委公布的学科趋势结论。对研究团队,可按“预测对象—方法创新—验证要求”整理这些论文,避免只按热门程度分配工时。 也要避免把机构背书当统计证据。评奖可能综合创新性、叙事和实用性,未必以同一资产池、成本和样本外区间评分。看板可以保留奖项为元信息,但推荐分中的证据分仍应来自原论文,而不能因为第一名自动给高分。

最大限制

公告未披露统一评分细则及完整评审过程,本次未读这五篇全部原论文,不评价它们具体收益或推断高低。按公告类型完成,不冒充论文解析。

复现与研究价值

将五篇作为待关联的独立研究条目,逐篇追踪原始版本、代码、数据与后续更正;先核验第三名LLM研究的训练时点与假设搜索预算,再谈研究自动化价值。

原文与核查

公开获奖公告完整阅读;未声称读完五篇获奖论文。

原始文章 ↗

推荐 41/100 · 问题 18/30 · 证据 11/30 · 方法 9/25 · 复现 3/15

研究导航有用,但公告几乎不提供方法或复现证据。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

内幕人买入信号的首要问题是何时能看到:四个集群前一天已涨1.61%

Most of the insider trading alpha is gone by the time you see the filing: poof!

Tommi Johnsen / Svetlana Shasharina

一句话先讲结论

这篇五天内部人交易观察最有用的是披露时点和程序性集群过滤,而不是标题中的“Alpha已消失”:作者后续7月审计修正了同一新闻管线的收益数据,并表示Form 4尚需正式时间序列检验。原文四个集群前日+1.61%、六个董事买入当日+3.55%只能保留为当时未复核的探索记录。

它到底在问什么?

长期学术研究中的内部人买入信号,经过公开披露和每日采集后还剩多少信息?同样被数据库标成买入,是否真的代表管理层主动看好公司?

作者具体怎么做?

  1. 先用20日窗口内至少三名不同内部人公开市场买入定义集群,结合身份和交易计划筛选,发现TSM的一组记录高度集中在同日同价。
  2. 人工审查后加入单笔至少1万美元和80%以上交易同日同价则拒绝集群的过滤,防止薪酬或计划性分配被当成独立集体买入。
  3. 分别观察集群、大额单一董事以及10%大股东交易在系统发现前一日、当日、后一日的超额收益;将战略投资交割与管理层自掏现金区分。

关键结果

原文结果与口径
核对项结果意味着什么
集群发现前一日+1.61%历史未复核探索值;同管线后续更正,本篇个案收益未被重新确认,不能作为有效Alpha证据。
董事买入当日+3.55%历史未复核探索值;同管线后续更正,本篇个案收益未被重新确认,不能作为有效Alpha证据。
程序性集群过滤80%同日同价作者据一次异常新增的规则,有用但尚未用独立样本验证假阳性率。

怎么理解?

最有用的部分不是追逐3.55%,而是把数据库里的“买入”拆回经济行为。许多人的小额同价买入可能来自一个公司计划,不能当作许多个独立的信心投票;大股东完成早已公告的投资,也不等于CEO首次用自己的钱下注。去重、身份和事件目的比单纯累计买入金额更重要。 同时要警惕标题过度概括。集群只有四例,无法证明“大部分Alpha已经消失”;每日管线延迟也不等于法律披露延迟。论文报告的交易日至披露日窗口、本文的系统发现前一日,是不同时间区间,不能用一个百分比直接互相验证。评论区声称的大样本复现没有独立材料,不作为本文证据。

最大限制

样本只有五天,集群和大额交易分别约4、6个,且作者没有三年内部人历史来应用完整惯常交易过滤。数据中具体TSM事件的性质还需原始Form 4核对;未提供可交易净收益与显著性。 后续7月审计揭示同管线收益基础缺陷,未重新确认本篇Form 4数值,因此不能将原文收益用于当前策略判断;后续文明确把内部人时间序列列为待检验。

复现与研究价值

建立交易日、SEC接受时间、首次采集时间和可执行时间四个字段,逐项链接原始申报;对同日同价集群做人工盲审。固定清洗规则后累积新样本,按内幕人身份分层,并比较申报后不同延迟的净成本收益。

原文与核查

公开正文完整阅读;未采用评论区未经核验的回测声称,未重查全部SEC申报。

原始文章 ↗

作者7月更正:原有收益结论撤回

推荐 66/100(暂定) · 问题 27/30 · 证据 9/30 · 方法 21/25 · 复现 9/15

时点和分类清洗有用,极小样本且同管线收益修正后未复核这些值。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 方法说明

不再一对一配股:把价差网络压成个股信号,再在组合层面对冲

The Metamorphosis

Kris Longmore / Robot Wealth

一句话先讲结论

如果XOM相对多个能源股都显得贵,而其他能源股彼此价格正常,逐对交易会反复买入并不便宜的对冲腿;作者建议把每条价差拆成两只股票的相反票数,再聚合为个股信号,直接买便宜股票、空昂贵股票。它改善的是信号利用和组合构造,但多条共享XOM的价差不是多份独立证据。

它到底在问什么?

传统配对交易同时持有两条腿,可能把一半购买力用在只是公平定价的对冲资产上;能否保留风险控制,同时把资本更集中地配置到真正异常的一端?

作者具体怎么做?

  1. 为候选股票构建重叠价差并标准化成z分数,观察某只股票是否相对多个伙伴都偏离。
  2. 把一条XOM–SLB价差的+2.3拆成XOM的+2.3和SLB的−2.3,对每只股票所有连接取平均;正值表示相对贵,负值表示相对便宜。
  3. 按聚合个股信号建立多空篮子,并在组合层控制净市场暴露;可以另研究价差质量、连接数量和信号一致性权重,但本篇未给出最终统一配置。

关键结果

原文结果与口径
核对项结果意味着什么
交易单位改变价差 → 个股多条配对提供信息,但实际订单在个股层净额化。
+2.3价差示例+2.3 / −2.3同一价差拆出的相反信号,不是两条独立预测。
收益改进未报告文章解释预期好处,未提供可审核收益表证明。

怎么理解?

这和把多个因子预测先汇总、再一次性优化组合是同一种设计思想:信号生成不必和交易对冲一一绑定。它能够减少重复持仓和无效对敲,也使风险预算从配对层提升到组合层。但便宜或昂贵仍是相对模型的判断,不是价格必然回归的事实。 最需要修正的是“更多票数就更有信心”。连接都共享同一股票,往往同时受该股票自身新闻或Beta变化驱动;多数票可能只是同一原因被重复计算。连接稀疏与连接密集股票的平均z分数也未必可直接比较。真正的置信度应考虑误差相关性和结构变化,而不能只数伙伴数量。

最大限制

未公开网络筛选、估计窗口、退市与借券处理、净额执行及完整风险约束;未证明个股聚合比原配对在同风险和成本下更好。允许净多净空漂移会增加方向暴露,不能同时声称仍有完全同等的对冲效果。

复现与研究价值

在固定历史股票池上比较逐对交易与个股净额组合,统一总杠杆、行业和市场Beta;按节点度数、信号分歧及公司事件分层检验收益,并记录净额化节省的换手。以上为未执行方案。

原文与核查

公开方法文章完整阅读;未执行网络统计套利。

原始文章 ↗

推荐 74/100 · 问题 27/30 · 证据 15/30 · 方法 22/25 · 复现 10/15

框架转换有用,共享节点依赖和完整回测仍待核验。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

每周挑3只ETF,10周与25周动量各一半:规则简单,参数选择并未消失

Active Dual Momentum GTAA Strategy

Sona Beluska / Quantpedia

一句话先讲结论

作者在9只ETF里每周选过去表现最好的3只,只持有动量为正的份额,再将10周与25周两个版本各配50%;最终策略报告风险调整指标接近0.9。它展示了多时间尺度配置的可能,但10、25和3都来自同一历史比较,不能因为最后只有几个参数就视为没有过拟合。

它到底在问什么?

跨资产配置如何比慢速战略组合更灵活,又不变成高换手日频交易?相对动量选强者、绝对动量转现金能否同时改善收益与回撤?

作者具体怎么做?

  1. 数据从2007年2月起,先固定选3只,测试1—12周和15—50周不同动量窗口,观察短长信号参数面。
  2. 固定25周回看后,测试选择1至9只ETF,发现过少更集中、过多更接近基准,作者偏向3至6只。
  3. 最终取选3只的10周和25周版本各半;正文部分长窗口结果从2008年起,应在相同起点重新比较,防止样本长度影响排名。

关键结果

原文结果与口径
核对项结果意味着什么
最终配置10周/25周各50%源于同一历史研究后的选择,不是预先冻结的独立验证。
每个子策略前3只且动量>0过滤后可低于满仓,风险下降部分来自现金。
风险调整指标接近0.9作者使用收益/波动的零无风险口径,不应与标准超额夏普混用。

怎么理解?

最好的方法披露是承认资产池也是参数。USO、QQQ与多只股票ETF会让结果受特定风险和时期影响;换一套看似同样合理的ETF,最佳窗口未必不变。比较参数附近表现比单点最优好,但还需检验资产池和调仓日的稳定性。 两个时间尺度平均能表达对速度的不确定性,却不会抹去此前看过的数据。更重要的对照应是相同投资比例和波动的被动组合,否则策略多持现金带来的回撤改善容易被当成选择能力。文章称周频取得平衡,需要用实际换手和成本检验,而不是由频率名字直接推导。

最大限制

公开文字未给完整交易费用、价格调整及同收盘执行细节;精确结果主要在图像表中,本文不臆造。调参、选池和子策略组合均使用同一历史,缺少冻结后的后验样本。

复现与研究价值

固定股票池和规则后,使用后续真实ETF数据前测;同时比较下一可成交价格、其他调仓日、合理交易成本与同风险基准。把所有测试过的窗口和组合记入试验台账,不只保留最后两条。

原文与核查

公开方法与结果讨论全文已读;图中未明确文本化的数值未补写。

原始文章 ↗

推荐 75/100 · 问题 25/30 · 证据 19/30 · 方法 21/25 · 复现 10/15

规则与参数面清楚,成本和真实样本外检验仍不足。

返回全年目录 ↑

Quantocracy / Word 标准 · 材料受限,不计完整解析 / 独立研究

跳空高开日内做空年化98%,但67%回撤、借券摩擦和2022后失效不能跳过

Identifying Stocks to Fade

Concretum Research

一句话先讲结论

作者筛选异常隔夜跳空股票做日内反向交易,2012年至2026年5月报告毛年化约98%、夏普2.08,却有约67%最大回撤,而且2022年后持续回撤。即使先不谈成本,这也不是一条“高收益所以可靠”的策略;完整筛选表仍在付费区,本条只解析可读实证与实施边界。

它到底在问什么?

大幅隔夜高开是否在开盘后回落?如果这种反转集中在难借、波动高的小盘股,统计可预测性还能有多少变成真实可执行收益?

作者具体怎么做?

  1. 公开部分说明选择异常大隔夜跳空股票,研究随后日内反转;样本2012年1月至2026年5月中旬。
  2. 股票池已剔除Russell3000流动性最差约30%,但剩余仍可能有薄交易、高波动和借券困难。
  3. 作者把毛收益与手续费、市场冲击和locate成本分开讨论,并指出2022年后曲线明显恶化;完整选股规则表在付费区,公开替代检索未恢复。

关键结果

原文结果与口径
核对项结果意味着什么
毛年化与夏普98%;2.08未扣全部实施摩擦,不是可直接外推的净Alpha。
最大回撤约67%很高的历史风险,不因年化更高就可以忽略。
近期稳定性2022年后明显恶化作者提出拥挤解释,但未用资金或借券数据识别因果。

怎么理解?

最值得研究的反差是:极端收益机会常常恰好出现在实施最差的地方。筛选波动最大的跳空股,会同时筛到更昂贵的冲击成本和更难借的空头;这些摩擦不是独立外生常数,而是可能与信号强度正相关。用平均手续费给98%打个折远远不够。 对2022年后的恶化,也不应仅靠“越来越拥挤”讲完。需要分别查看候选数量、跳空幅度、开盘成交质量、幸存者结构和参数选择。真正的结构变化与过去偶然赚钱,在一条事后净值上很难区分。作者承认失效比只展示全样本指标更有价值,但不能据此证明此前收益的机制。

最大限制

完整选股与执行条件无法公开取得,故标部分解析;未绕过付费。原始交易流水、借券可得性和净成本结果均未独立验证,相关论文不能补齐作者私有规则。

复现与研究价值

拿到规则后先做可借券时点交集、跳空分位与流动性分层,使用实际locate报价和成交约束;按2022年前后固定分段审计,先判断原始条件效应是否仍存在,再研究替代交易。

原文与核查

公开实证与限制正文已读;完整筛选表受订阅限制,检索作者公开回顾未恢复。

原始文章 ↗

推荐 62/100(暂定) · 问题 25/30 · 证据 15/30 · 方法 19/25 · 复现 3/15

负面实施与近期失效信息重要,关键方法受限、毛收益不能直接采用。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 方法说明

三次迭代逼近机器精度还不够:隐波求解器最终卡在浮点边界和定价函数

A Faster Monotone Implied Volatiltty Solver

Fabien Le Floc’h

一句话先讲结论

Thiophene把价格对数上的Euler–Chebyshev迭代与互补价格对数上的Halley迭代拼起来,作者称约三次迭代即可达到机器精度;但真正稳健还需要极小价格修正和高精度重定价抛光,后者约占20%计算时间。数学上的单调收敛,只解决了问题的一半。

它到底在问什么?

能否做出兼有收敛保证、数值稳定性和实际速度的Black–Scholes隐含波动率求解器,而不是依靠常见牛顿法在极端报价下碰运气?

作者具体怎么做?

  1. 把单调收敛思路扩展到归一化价格对数上的Euler–Chebyshev方法,加快靠近解的速度。
  2. 当归一化价格c靠近1,改用互补价格1−c的对数;原迭代此时不再有同样单调性,因此切换为Halley方法。
  3. 对极小价格加入Bachelier基础的细化,再可选使用Jäckel高精度Black–Scholes定价函数做最后抛光,以减少残留误差。

关键结果

原文结果与口径
核对项结果意味着什么
迭代次数约3次作者对组合方法的报告,不是本文对全部输入范围实测的最坏迭代上限。
最终抛光成本约20%追求接近机器精度并非免费,可根据应用需要决定是否开启。
核心风险收敛保证≠浮点稳健公式在精确实数下成立,边界数值运算仍可能丢失有效信息。

怎么理解?

研究员容易只关注求根算法的阶数,却忽略它调用的价格函数是否足够准确。若定价函数本身在尾部存在误差,求解器越努力收敛,可能越精确地求解一个错误方程。把残差计算、变量变换和求根迭代一起审计,比单独比较牛顿与Halley更贴近生产问题。 这篇也展示了性能工程的合理取舍:最后20%的抛光开销可能对严格校准很重要,却不一定对粗粒度行情筛选值得。应先规定最终价格误差、希腊值稳定性与尾部失败率的容忍标准,再决定使用哪种模式,而非把“机器精度”当成所有任务的统一目标。

最大限制

本次完整阅读算法介绍,但未逐页审核论文证明,也未运行Java或Rust代码;公开博客没有完整输入网格和相对耗时表,因此不宣称已独立证明比Jäckel更快。

复现与研究价值

按实际交易所报价范围建立一致测试集,并比较开启、关闭抛光两种模式;对无套利边界附近输入记录返回状态而非静默给数。独立验证重定价误差后,再将新求解器作为可回退的生产候选。

原文与核查

公开博客完整阅读;原论文与代码仅定位,未执行或逐证明核验。

原始文章 ↗

Thiophene原论文

推荐 82/100 · 问题 25/30 · 证据 21/30 · 方法 24/25 · 复现 12/15

工程问题与算法路径清楚,论文证明及完整跨实现基准尚未独立核验。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

VWAP退出的夏普最高,却不是每年赢家:四种出场规则该如何选

How to Manage an Intraday Trend Trade

Concretum Research

一句话先讲结论

同一SOXX日内ATR突破信号,只改变退出规则,2012—2026年VWAP退出夏普1.16、年化18.3%领先;但开盘价退出平均每笔赚6.8bp,高于VWAP的6.1bp,代价是更深的交易内不利波动。不同指标和年份没有同一个赢家,最优出场点不能只靠全样本夏普挑选。

它到底在问什么?

入场不变,退出用开盘价、日内中线、VWAP还是抛物线SAR?细小实现差异会改变交易次数、利润分布和持仓承压,如何避免挑到历史最幸运的版本?

作者具体怎么做?

  1. 比较回到开盘价、触及累计高低中点、回到VWAP及PSAR追踪退出;PSAR首次以开盘初始化,后续交易继承此前止损水平。
  2. 从组合指标进一步下钻交易笔数、平均每笔收益和交易内不利波动,区分赚钱效率与承受路径。
  3. 查看年度夏普排名,发现顺序轮换,作者因此建议给多个有经济逻辑的退出版本分配风险,而不是全押历史第一。

关键结果

原文结果与口径
核对项结果意味着什么
VWAP全样本夏普1.16;年化18.3%样本内最高,不代表未来或净成本后仍最高。
平均每笔收益开盘6.8 vs VWAP6.1 bp毛收益,退出更快可能减少单笔利润并增加成本负担。
交易内不利波动约89 vs 64 bp与单笔平均利润相比不小,持有过程风险不可忽略。

怎么理解?

这篇的优点是把“最佳”拆开:组合夏普、单笔利润、交易次数、承受的反向波动不是同一目标。净成本策略可能更偏好少交易,而风险限额可能更偏好更快退出,只有事前明确目标才能避免事后用最漂亮的指标证明选择正确。 集成体现了参数不确定性,但它不是免费分散。这四条策略共享同一SOXX入场和大部分持仓,危机中可能同时受损;同时运行可能增加实现复杂度和换手。应比较净额后的集成订单与单版本,而不是把四条毛收益曲线平均后就宣称风险完全消失。

最大限制

单一半导体ETF、毛交易统计,公开文章未提供完整ATR参数、分钟数据清洗和执行成本;原文没有给出集成组合的独立数值结果,不能补写其夏普提升。

复现与研究价值

锁定四种退出后,在其他预先指定资产和未来区间测试,统一成交延迟与滑点;比较等风险集成、净额交易与单版本的净收益、最大仓位和尾部滑点。优先验证稳健区域,不继续搜索更多退出规则。

原文与核查

公開正文與结果数字完整阅读;未重新运行SOXX分钟回测。

原始文章 ↗

推荐 79/100 · 问题 27/30 · 证据 21/30 · 方法 23/25 · 复现 8/15

控制变量与多指标比较清楚,单资产、毛成本和集成未实测限制外推。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 方法说明

把新兴市场历史延到1926年:合成日收益不能当成新增的真实市场经验

A Century Without Data: Reconstructing Emerging Markets Equity History

David Belobrad / Quantpedia

一句话先讲结论

作者用出口额代理盈利、美国估值锚定新兴市场估值,再借美国股市的日内年内波动形状,构造1926年以来的新兴市场指数。它能补齐一条曲线,却没有凭空补出真实交易日:若用它检验股市相关性、危机分散和趋势收益,结果可能很大程度上重现了合成规则自己的假设。

它到底在问什么?

新兴市场可靠日数据很短,而多资产长历史研究需要更早序列;能否用低频宏观与价格资料构造替代历史,并明确替代历史能回答什么、不能回答什么?

作者具体怎么做?

  1. 1926—1989年先估计低频增长路径,把美国股市剥离平滑增长后的波动成分按比例移植,构造年内变化。
  2. 国家层面假设相对美国的长期估值关系较稳定,以出口历史代理盈利,汇总阿根廷、巴西、智利、印度、南非和中国等可构造国家。
  3. 1989—1997年改用Fama–French月度新兴市场组合锚定,1997年后衔接MSCI日指数,2003年后使用EEM代表,并在连接点缩放保证连续。

关键结果

原文结果与口径
核对项结果意味着什么
序列延伸1926年7月起早期是模型生成的代理,不是当时每日成交记录。
盈利代理历史出口额出口与上市公司盈利的对应关系依赖产业、汇率、利润率及所有权假设。
高频形状来源美国股票波动残差人为引入跨市场共同波动,不能再把由此得到的相关性当独立发现。

怎么理解?

这个方法可以用于压力情景生成,但应与实证历史分层存储。研究者需要区分:某个风险结果来自实际观察,还是来自美国股市路径被移植过来。尤其研究分散化时,如果先让新兴市场共享美国冲击,再发现两者危机共跌,这很可能是输入假设的回声。 出口也不是股东收益。国内销售、资本结构、国有化、交易所关闭、外资准入和汇率都会改变投资者实际能拿到的现金流;把企业生产能力平滑映射成价格,会遗漏最重要的制度断点。文章对中国终值归零的处理说明作者意识到这一点,但其他国家也需要同样严格的事件审计。

最大限制

完整代理数据、权重和参数未公开核验;年度/月度插值使用未来期末值,不可直接进入无前视日度回测。来源时期和可投资性差异明显,长序列不等于大量独立真实样本。

复现与研究价值

在数据字段逐日标注真实、插值、代理和人为事件处理;以多组波动锚和出口—盈利假设生成情景区间,而非单一路径。策略检验主要放在真实可投资时期,合成段只做敏感性压力测试。

原文与核查

公开重建方法全文已读;未独立复算合成指数。

原始文章 ↗

推荐 60/100 · 问题 24/30 · 证据 12/30 · 方法 18/25 · 复现 6/15

重建假设公开有价值,但不能把合成高频数据当百年实证。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

1199条新闻只有106条被判有方向,而FinBERT把其中44条提前判成中性

Nine Pounds of Ore for an Ounce of Gold

Tommi Johnsen

一句话先讲结论

在一天1199条财经新闻里,Claude把106条判为可行动的方向性信息,其余1093条为中性;但FinBERT又把这106条中的44条判成中性,漏掉约41.5%的Claude方向样本。由此更应得出的结论是审计过滤器的漏检,而不是因为大多数新闻无用,就放心永久删除所有小模型中性项。

它到底在问什么?

新闻模型判断的是语言正负面,还是对指定公司的新事件?如果二者不是同一个任务,传统情绪分类结果能否直接成为投资信息入口?

作者具体怎么做?

  1. 日度管线采集九个行业的1199条内容,检查中性池里报价页面、错代码、多公司泛谈、重申评级和旧事件回顾等类型。
  2. 把两个模型的标签交叉列联:Claude中性1093条中,FinBERT也判中性的900条;其余103正面、90负面。
  3. 反向检查Claude有方向106条,其中FinBERT判39正面、23负面、44中性,分析平淡事实性措辞与强烈评论措辞如何造成不对称分歧。

关键结果

原文结果与口径
核对项结果意味着什么
Claude方向标签占比8.8%单日模型定义下的占比,不是所有金融媒体中客观有用信息的固定比例。
方向池漏检44/106 = 41.5%若硬丢弃FinBERT中性项,这部分Claude认为有信息的样本永远不会到下一层。
中性一致率900/1093 = 82.3%条件在Claude中性池上的一致率,不是全模型准确率,也不是正类召回率。

怎么理解?

文章把“情绪语气”和“事件信息”分开,适合用来重新定义新闻工程的目标。真正有价值的改进可能先来自实体匹配、去重、首次事件识别和事实抽取,而不是在正负标签上追求更高小数点精度。反复转述同一消息的十篇文章,不应被当作十份独立证据。 原文建议信任FinBERT中性并只升级非中性项,这与其自己报告的41.5%漏检存在张力。对总体占比低的目标,整体中性一致率很容易看起来不错,正是因为大量无关样本压低了平均错误。生产系统应该随机抽检被过滤部分,直接估计损失的信息价值,而非只展示进入下一关的标签质量。 后续更新:作者7月审计仍观察到小模型对正面催化漏检更强的不对称,但次日收益优势与模型排名并未成立。分类分歧可以保留为工程事实,不能再向上推成已验证Alpha;原混合级联已退出生产。

最大限制

这是单日列联分析,方向标签由Claude定义;文章没有独立人工标注或冻结后的交易检验。原文对“没有新信息就不预测明天”的强断言也未经此表证明,媒体关注量本身可能影响成交或波动。

复现与研究价值

把正类召回、错误实体率、重复事件率和每千条成本并列展示;对中性池分层随机复核,并保留关注量与新闻类型特征。硬过滤、不确定性升级和全量模型需在同一人工标注集及时间截点上比较。

原文与核查

公开正文完整阅读;未独立核验1199条新闻或运行模型。

原始文章 ↗

作者7月更正:原有收益结论撤回

推荐 80/100 · 问题 28/30 · 证据 19/30 · 方法 23/25 · 复现 10/15

列联数字足够揭示过滤器风险,模型标签不是真值且单日样本限制外推。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 论文导读

散户猜对51.3%却亏钱,机器人猜对49.9%却赚1.33亿美元:入场价比胜率重要

Who Profits from Prediction Markets?

Joshua Della Vedova;Quantpedia导读

一句话先讲结论

在2.22亿笔已结算预测市场交易里,散户方向正确率51.3%却亏损,机器人49.9%却累计赚1.33亿美元;论文把选对方向与支付的价格分开后发现,盈利差别主要在执行。它并不是说随机下注能赚钱,而是买入价格已经隐含概率,判断对了也可能买得太贵。

它到底在问什么?

为什么预测正确率更高的参与者,最终反而亏钱?研究交易技能时,方向判断和执行价格是否被错误压缩成一个指标?

作者具体怎么做?

  1. 利用已结算Polymarket交易,按交易者类型比较方向正确率和损益,再将收益拆成方向与执行组成。
  2. 检查两种能力的依赖性以及执行基准敏感性;作者指出包含自身交易的传统VWAP可能人为制造二者负相关。
  3. 用1410万笔CBOE期权观察检验边界:两维可分性仍存在,但方向准确率与盈利的反转不再出现,因为期权还允许选择执行价、期限等其他维度。

关键结果

原文结果与口径
核对项结果意味着什么
机器人方向与损益49.9%;+$133M样本累计群体损益,不是年化收益,也不能代表任意机器人。
散户方向正确率51.3%高于50%不足以证明信息优势,买入价格决定盈亏平衡概率。
外部市场检验1410万期权观察可分性与胜率利润反转是两条不同结论,后者没有普遍外推。

怎么理解?

对量化研究员,最直接的迁移是把预测质量与经济决策质量分开。新闻模型、LLM事件概率或分类胜率即使改善,若市场在模型出结果前已经调价,就未必有收益;评价必须同时记录决策时价格、等待成本、成交方式与实际可得利润。 但执行与信息也不应被绝对对立。更早进入本身可能需要承担不确定性,挂单收入也可能补偿逆向选择;“执行优势”不是无风险的钱。交易者类型由行为识别,钱包是否同一主体、机器人分类是否准确以及资本规模差异,都影响对群体结果的解释。

最大限制

已读导读及原论文摘要、作者网站资料,未逐页审核112页最新版本或链上重构流程。作者网站持续更新,不能拿最新累计收益替换研究样本;未独立核验费用及钱包分类。

复现与研究价值

自己的预测实验应同时保存概率、报价、订单与成交时点,按价格隐含概率评价校准,再按执行成本评价净收益;避免用自身成交构成的基准给自己打分。先做冻结前测而非从机器人总利润推导可复制策略。

原文与核查

公开导读完整阅读;SSRN摘要及作者研究网站核对,未逐页审计原论文。

原始文章 ↗

原论文SSRN6191618

作者研究主页与数据说明

推荐 83/100(暂定) · 问题 29/30 · 证据 24/30 · 方法 23/25 · 复现 7/15

大样本与边界检验有价值,执行分解及账户识别尚未独立重建。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 论文导读

商品期货155年风险溢价约5.4%:关键不是商品一直涨,而是期货与现货不同

An Index of Commodity Futures Returns Since 1871

Rajkumar Janardanan / Xiao Qiao / K. Geert Rouwenhorst;Quantpedia导读

一句话先讲结论

论文用1871—2025年的历史商品期货资料,摘要报告平均年风险溢价约5.4%,约43%的年份跑赢股票;导读所引表格给出期货夏普0.38、股票0.41、商品现货0.22。这个结果支持期货是一类有独立收益来源的资产,而不是“现货商品长期上涨就能复制”的简单故事。

它到底在问什么?

现代商品指数历史有限,只保留今天还活着的合约也会高估效果;把停交易品种放回历史后,商品期货风险补偿是否仍成立?

作者具体怎么做?

  1. 作者从交易所年鉴和报纸档案手工收集期货价格,纳入现存与已消失合约,减少只看成功品种的幸存者偏差。
  2. 构建长期分散指数并与股票、通胀比较,统计年度和十年区间的相对表现,而不只看155年终点财富。
  3. 把期货超额收益与现货及经利息调整的基差/展期部分区分,检验正回报是否仅由现货上涨解释。

关键结果

原文结果与口径
核对项结果意味着什么
平均风险溢价约5.4%/年摘要口径;不是CAGR,不保证未来同样大小。
股票相对表现约43%年份跑赢分散来源并不要求多数年份获胜,也不等于收益完全不相关。
夏普比较期货0.38 / 股票0.41来自导读引述表格,风险效率相近而非期货全面占优。

怎么理解?

这篇最重要的增量在于数据覆盖,而不是再宣布一次商品可分散。将消失的合约放回去,可以避免只用今日成功市场重写历史;对任何长历史资产研究,这都是比漂亮终点曲线更基础的贡献。研究员应优先看合约进入退出规则、缺失报价和抵押品处理。 但长样本仍可能把许多制度混在一起。交易成本、交割规则、市场参与者和投资限制都变化过,155年平均值不能直接成为今天战略配置的输入。现代可投资指数还可能偏能源,和历史等权篮子不同;需要分阶段、分品种和等风险比较来判断哪些结论可迁移。

最大限制

已读公开导读、SSRN摘要及作者机构资料;未逐页取得并审计原论文数据表。5.4%与5.5%差异保留说明,未复制来源的大段引文;数据库并非已独立下载重算。

复现与研究价值

先以真实可交易合约复核近代子样本,并分别报告现货、超额期货、抵押品利息和净成本;用包含退市合约的历史清单检查幸存者偏差,避免在配置模型里直接填入155年单一均值。

原文与核查

导读完整阅读;SSRN摘要与作者机构说明核对,未逐表审核原论文全文。

原始文章 ↗

原论文SSRN6276738

作者机构研究资料

推荐 79/100(暂定) · 问题 28/30 · 证据 22/30 · 方法 22/25 · 复现 7/15

长历史与退市合约处理贡献大,完整数据和方法尚未独立审计。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

六周暴涨后一年平均涨18.8%,但“历史最强20次”本身是事后排序

A Historical Look at the Top 20 6-week $SPX Rallies Since 1950

Rob Hanna

一句话先讲结论

作者选出1950年以来不重叠的20次最强30交易日上涨,历史先例随后一年平均涨18.8%,高于基准9.4%;短期一个月却通常进展有限。这支持区分反弹后的短期消化与长期延续,但事后选“最强20次”并不是当时已知的交易阈值。

它到底在问什么?

六周涨得太多,意味着过热即将回撤,还是说明中长期动量很强?上涨从深度熊市开始与从浅回撤开始是否不同?

作者具体怎么做?

  1. 从1950年以来寻找30交易日强涨窗口,排除重叠后保留20个最强事件,包含当前观察。
  2. 用起点回撤20%作状态划分,比较短期与一年后的表现;当前属于相对浅回撤后强涨。
  3. 对八个非熊市案例补充平均后续回撤与上涨幅度,观察路径风险而非仅终点收益。

关键结果

原文结果与口径
核对项结果意味着什么
一年平均收益18.8% vs 9.4%事后极端事件条件均值,不是可执行规则CAGR。
短期与长期一个月弱,一年较强同一事件的不同持有期可能给出不同叙事,必须预先指定目标。
非熊市路径回撤约8.29%八例平均路径风险,未来仍可能更差。

怎么理解?

强上涨之后既可能短期回吐、也可能长期继续上涨,两者并不矛盾。这篇把时间尺度放在一起,比一句“涨多了要跌”更有信息量。研究员应把预测期限固定,再讨论动量或反转,而不是在不同期限之间挑一句支持已有仓位的话。 关键方法问题在于“前20名”的阈值是看完整段历史后才知道。真实使用时只能根据当时历史分位或固定涨幅触发,而且早期和近期事件的市场制度不同。把不重叠处理加入设计有帮助,但一年结果仍可能共享宏观时期,事件数并不等于独立样本数。

最大限制

未独立读取完整事件表;胜率分母与文字描述有待核验。未见固定事前阈值、成本或样本外检验,强涨选择与非熊市细分均可能增加搜索自由度。

复现与研究价值

用固定30日涨幅阈值或仅依赖此前数据的分位数触发,锁定重叠排除规则;比较1、3、12月分布并进行按年代留出检验。先验证能否实时识别,再讨论仓位应用。

原文与核查

公开正文完整阅读;未独立核验原始事件表。

原始文章 ↗

推荐 61/100 · 问题 21/30 · 证据 16/30 · 方法 15/25 · 复现 9/15

期限对比和路径统计有价值,事后排序与小样本限制推断。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

翻倍股占比仅为科技泡沫时的四成,但这不是市场还能涨多少的尺子

The 100% Club. 2000 Tech vs 2026 AI

Cesar Alvarez

一句话先讲结论

作者比较纳斯达克100中过去一年翻倍的股票占比:2000年科技泡沫高点约53%,2026年这次观察约20%;当前涨幅前十名的平均表现虽然接近当年,但剔除SNDK这个极端值后便明显下降。它说明两轮行情的上涨广度和集中程度不同,不能据此推出当前市场便宜,更不能把距离53%的差额当作剩余上涨空间。

它到底在问什么?

同样被称为科技泡沫,当前行情究竟是大批股票普遍疯狂,还是少数明星股把整体印象拉高?估值指标之外,价格分布能否提供另一种诊断?

作者具体怎么做?

  1. 作者用AmiBroker及Norgate数据观察纳斯达克100成分股过去一年价格表现,把上涨超过100%的股票归入同一组,计算占比。
  2. 将科技泡沫顶部与当前观察点对照,同时检查历史上超过30%的时段;作者指出这些时段多数出现在市场低点之后,而不只出现在顶部。
  3. 另取过去一年涨幅最大的十只股票,比较平均涨幅;当前SNDK对均值影响很大,于是再使用第二至第十名重算。

关键结果

原文结果与口径
核对项结果意味着什么
翻倍股票广度53% vs 20%两个观察截面的纳指100占比,不是市场见顶概率。
超过30%的历史情形多数在市场低点之后极端上涨既可能来自泡沫,也可能来自低基数反弹,不能只作看空解释。
当前前十名均值受SNDK明显影响剔除第一名后与2000年的差距扩大,提示均值对离群值敏感。

怎么理解?

这篇的价值在于把“市场疯了”拆成两个不同问题:上涨是否足够广,以及上涨是否由极少数股票贡献。对量化研究员,两者应该分别进入市场状态描述,而不是合并为一个笼统泡沫标签。截面分位数、翻倍股比例与集中度能帮助确认目前正在交易哪类风险。 但文末从“还不如2000年疯狂”推到“仍有很大上涨空间”,证据跨越过大。历史上的最高极端值不是市场必须再次达到的目标;更低的翻倍股占比也可能同时伴随更高的估值、更弱的盈利兑现或不同利率。拿一个著名顶部作为标尺,还容易事后挑选最能支撑叙事的参照。

最大限制

公开文章是描述性图表比较,未提供条件未来收益、样本外检验或顶部识别准确率;本文未独立核验历史成分与退市处理,也不把作者的估值背景陈述当作当前市场事实。

复现与研究价值

可把翻倍股比例、收益中位数、前十分位收益和第一大贡献者占比同时做成历史序列,按固定阈值检验后续1—12个月的收益分布,并分别控制此前跌幅和估值。先检验是否增加预测信息,再决定能否进入仓位规则;这是未执行方案。

原文与核查

公开文章正文完整阅读;未重新计算图表或回测。

原始文章 ↗

推荐 58/100 · 问题 20/30 · 证据 15/30 · 方法 14/25 · 复现 9/15

分布视角清晰,但两轮行情类比不构成预测检验。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

给策略净值加均线开关:回撤变小,风险调整收益却没有普遍改善

"Surfing the Equity Curve": Using Trend-Following to Switch Strategies On and Off

Allocate Smartly

一句话先讲结论

对100多条TAA策略分别设置净值均线开关,样本从1973年开始:1/2月均线只保留约69%的投资仓位,2/36月约96%;多数设置降低最大回撤,却没有一组在夏普上超过平均策略。唯一在UPI上占优的6/12月组合也缺少周边参数支持——净值看起来更平滑,不等于策略真的更有效。

它到底在问什么?

已经有了一套策略,能否在它最近表现不好时暂停,等净值重新向上再恢复,从而避开失效期?这是对策略本身择时,不是对底层资产再做一次趋势交易。

作者具体怎么做?

  1. 每个月末比较一条策略净值的短期X月均线与长期Y月均线,短线高于长线则下个月保持配置,否则该份额持有现金。
  2. 遍历不同短长均线组合,比较年化收益、夏普、最大回撤,以及兼顾回撤深度和持续时间的UPI,而非只展示最好的一组参数。
  3. 另外测试过去X个月收益大于零的绝对动量开关,并把比较门槛改为同期国库券收益;这些替代规则没有改变总体结论。

关键结果

原文结果与口径
核对项结果意味着什么
平均投资比例69%—96%不同均线设置对应的资产暴露差异,不能把低暴露带来的回撤改善全归功于预测。
夏普改善未见普遍优势作者报告所有组合未超过平均策略,不等于已证明任何净值择时方法都无效。
UPI孤立亮点6/12月单个设置优于对照,周边参数未形成稳定区域,作者判断可能是噪声。

怎么理解?

一个容易忽视的问题是:原策略已经可能包含趋势过滤,再对它的净值做趋势过滤,相当于在一串经过调整的收益上追加延迟。亏损发生后关闭、反弹发生后重新打开,既可能错过恢复,也会削弱原本来自多策略同时运行的分散作用。本文把许多策略放在同一规则下检验,比展示某条策略上漂亮的开关净值更有说服力。 但“没有一组普遍有效”与“任何特定条件都没有作用”仍不同。真正的系统故障、数据失真或交易成本恶化,可能值得停机,却不一定表现为简单均线跌破。收益择时和研究治理应分开:前者需要可重复预测优势,后者可以基于明确的实施失效证据。

最大限制

完整底层收益库并未在公开文章提供;平台当前收录策略向历史延伸可能带有选择偏差。额外切换成本未计,实际表现只会受到进一步拖累。图中未在正文列出的夏普或年化值不臆造。

复现与研究价值

复现时加入等平均仓位的静态降风险对照,分解收益损失来自现金拖累还是错误开关;冻结参数后检验恢复期漏赚和新增换手。若设置停机机制,应让数据质量、成交偏差等诊断与净值信号分别记录。

原文与核查

公开研究正文完整阅读;未独立重跑平台策略库。

原始文章 ↗

推荐 80/100 · 问题 27/30 · 证据 22/30 · 方法 23/25 · 复现 8/15

大范围负面结果和参数面比单例择时展示有用,完整收益库与切换成本仍不足。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

用经理平均仓位替代固定60/40,年化7.9%变9.1%,但股票敞口也多了6个百分点

The NAAIM Exposure Index: Incorporating Active Investment Mgr Sentiment into Asset Alloc

Portfolio Optimizer

一句话先讲结论

每季末把NAAIM过去13周平均读数当股票权重,其余配债,2006—2026年回测年化9.1%,高于60/40的7.9%,周频回撤25%对34%;但平均股票仓位也从60%升到66%。这说明调查驱动配置值得研究,尚不能把1.2个百分点收益差全部称为择时Alpha。

它到底在问什么?

长期股债投资者能否用主动经理实际仓位调查,做低频、透明的配置调整,而不是构建复杂日频信号?

作者具体怎么做?

  1. 先说明NAAIM周度自报仓位可包括空头和杠杆,并同时关注中位数与离散程度,避免把平均数解释为所有经理一致持仓。
  2. 季末计算13周简单均值,将其百分比配置到股票,余额配置债券,持有至下季;用2006年9月至2026年2月数据比较。
  3. 报告收益、波动、夏普与周频最大回撤,同时承认更细频率会显示更大回撤,调查时间与实际后续仓位亦可能不同。

关键结果

原文结果与口径
核对项结果意味着什么
年化差9.1% vs 7.9%历史组合结果,未分离更高股票平均仓位的贡献。
平均股票敞口66% vs 60%公平对照还应包括固定66/34或同风险组合。
周频最大回撤25% vs 34%仅周度观察,不能代表持有期间真实最大损失。

怎么理解?

这类规则的好处是容易解释和执行:用平滑调查代替固定股票比例,降低决策频率。但它也把一群经理的行为当作外部模型,这些经理可能已经在追趋势,因此需要检查调查究竟新增了信息,还是仅把已有价格趋势换一种包装。 还应审计仓位边界。原始调查允许负值与超过100%,若13周平均也越界,公式可能隐含卖空或杠杆;生产实现不能默默截断而又沿用未截断回测。定义、边界和发布时间都应写进规则,而不是只保留一行均线。

最大限制

本次完整阅读作者复现说明,未独立运行API或数据。成本、负/超100读数处理与无风险夏普口径未充分展开;调查样本、分歧及周频风险限制外推。

复现与研究价值

加入固定66/34、价格动量配置和同波动60/40对照,用日价格计算风险并计入费用;严格使用发布时间之后的信号,明确权重截断规则,检查是否仍有风险调整增量。

原文与核查

公开方法与结果表完整阅读;未执行数据API或复现。

原始文章 ↗

推荐 76/100 · 问题 24/30 · 证据 21/30 · 方法 21/25 · 复现 10/15

简单透明且数值完整,更高股权暴露与周频风险尚需拆解。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

追最近高夏普的TAA策略:12个月窗口有亮点,却在2011年后失去优势

Selecting TAA Strategies Based on Recent Performance, Part 2: Recent Sharpe Ratio

Allocate Smartly

一句话先讲结论

从100多条TAA策略里每月挑最近夏普最高的几条,12个月回看、选3条的组合给出UPI 3.59,高于平均策略3.05;但作者指出这种优势在2011年后已无效,短于12个月的回看尤其差,而且尚未扣除策略切换的额外摩擦。因此它不是一条已经得到稳健支持的“追高夏普”规则。

它到底在问什么?

直接追最近收益最高的策略容易追到高风险策略,改成追风险调整后的夏普,能否更可靠地选择下一阶段的赢家?

作者具体怎么做?

  1. 以平台100多条TAA策略为候选,从1973年起进行月度筛选,分别改变回看长度和最终持有策略数,检查参数面而不是只展示最优组合。
  2. 比较年化收益、夏普、最大回撤和UPI;特别观察小于12个月与至少12个月窗口的区别。
  3. 再去掉无风险收益门槛,用收益/波动替代夏普排名。策略选择因此更偏向收益路径平稳的资产,但没有改变缺少稳定优势的结论。

关键结果

原文结果与口径
核对项结果意味着什么
最好看的公开例子UPI 3.59 vs 3.0512个月回看、选3条;这是参数格中的结果,不能当作预先指定规则的样本外证据。
较短回看小于12个月更差四类指标均有明显差异,短样本夏普估计噪声可能抵消轮动价值。
分段稳定性2011年后无效作者文字披露,未展示分段完整数列,故不进一步推算损失幅度。

怎么理解?

追夏普比追总收益更合理,但并不会消除选择误差。候选策略的短期波动、共同持仓和危机暴露都可能暂时改变排名;选出的是“最近看起来顺”的路径,不一定是未来预期收益真正提高。候选高度相关时,三个不同名字也可能代表同一种风险。 作者对孤立UPI亮点保持谨慎是这篇最有价值的部分。真正可信的轮动改进应该同时有机制、邻近参数稳定性和时间稳定性;从完整参数表挑出一个胜者,再用全样本指标给它背书,恰好又回到了策略筛选原本要避免的问题。

最大限制

没有公开完整候选收益库、策略首次可投资时间与分段统计。基础策略成本已计,策略间切换成本未计;两者不能混为“已经净成本”。去掉无风险门槛改变排名偏好,但不宜据此普遍断言夏普必然偏爱高风险。

复现与研究价值

在自有策略库上先做按首次上线时间的滚动候选池,再把夏普排名与收益排名、等权、风险平价比较;以相关簇为单位限制重复风险,并单独报告换手成本和危机后恢复期表现。固定检验方案后再观察未来月份。

原文与核查

公开正文完整阅读;未重新计算平台策略收益。

原始文章 ↗

推荐 77/100 · 问题 26/30 · 证据 21/30 · 方法 22/25 · 复现 8/15

负面结果与时间失稳披露有用,数据和分段结果开放度有限。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

黄金与比特币轮动年化64.7%,降风险后只剩12.0%:暴露调整才是故事关键

Dual Momentum Allocation Between Physical Gold and Bitcoin (Digital Gold)

Cyril Dujava / Quantpedia

一句话先讲结论

2018年底至2026年4月,黄金/比特币/现金的4、8、12周动量等权组合报告年化64.73%、最大回撤49.40%;加上基于12周波动估计的降仓后,年化降至12.01%,回撤收窄到12.27%,夏普反而由1.47小降至1.37。风险确实下降,但不能把降杠杆后的低回撤等同于新增Alpha。

它到底在问什么?

黄金与比特币常被放进同一个保值叙事,但波动和危机表现很不一样。能否用相对强弱择一,再用绝对动量转现金,让配置更可控?

作者具体怎么做?

  1. 将Bitfinex小时比特币价格对齐GLD的纽约交易收盘时点,使用2018年底至2026年4月样本,并讨论后期BITO、IBIT实现载体。早期历史并不是当时已经存在的IBIT交易记录。
  2. 遍历1、2、3、4、6、8、12、20、24、28周动量;原文8周表现最好,再构建4、8、12周等权复合版本以分散单参数选择。
  3. 选择资产后用12周滚动波动年化,按示例可理解为min(1,20%/估计波动)配置,剩余现金;原文公式排版不完整,复制前需要核对代码。

关键结果

原文结果与口径
核对项结果意味着什么
复合年化64.73% → 12.01%降风险大幅降低收益和暴露,不是保持收益免费削去回撤。
最大回撤−49.40% → −12.27%历史改善,仍不保证未来回撤受同一界限约束。
夏普1.47 → 1.37使用零无风险利率口径,降风险后的全样本风险效率略降。

怎么理解?

最应该拆开的,是资产选择与仓位选择的贡献。原策略在比特币大波动期承担很高风险,复合参数也没有避免接近50%的回撤;风险调整后的结果更适合稳健预算,却不能称为动量选择能力被进一步证明。需要一个相同平均波动或相同平均仓位的被动组合,才能看清择时有没有独立贡献。 另一个关键是资产代理的可交易历史。现货比特币、期货ETF和现货ETF涉及不同费用、展期和交易时段,把它们串成一条方便的序列并不能消除这些差别。周三收盘既用于判断又用于执行,也必须明确是否有滞后;只有当天已知数据才能决定后续真实成交。

最大限制

参数最优区间及复合选择均在同一历史上观察,未见冻结后的独立样本。公开正文对ETF代理、同收盘成交、现金利息和交易成本披露不足;风险权重公式有排版问题,不能直接无核对复制。

复现与研究价值

先用现货数据与真实ETF成立后数据分别复现,明确下一可成交价格、手续费及价差;加入同波动被动混合对照,并把参数选择放入内层窗口。按周审计预测波动与实现波动偏差,不把20%视为硬保证。

原文与核查

公开正文及文字结果表完整阅读;未下载原始行情或执行回测。

原始文章 ↗

推荐 74/100 · 问题 26/30 · 证据 19/30 · 方法 20/25 · 复现 9/15

收益风险对照充分,但代理历史、成本和参数选择限制策略结论。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 方法说明

回撤优化了17%,却只是绕开两笔亏损:一次策略修改的过拟合审计

Bad Month for Your Strategy? Should You Change It?

Cesar Alvarez

一句话先讲结论

某策略遭遇最差回撤后,增加规则让CAR相对提高约5%、最大回撤相对缩小17%、夏普提高15%;看起来全面改善,但作者进一步发现,主要收益来自绕开引发修改念头的两笔交易,其他大回撤几乎未改善。文章最终不接受这次修改:改好了历史伤口,不等于学到了可迁移规律。

它到底在问什么?

真实交易亏损后发现一个看似合理的新过滤条件,究竟是在修复策略,还是在为刚发生的亏损寻找事后借口?

作者具体怎么做?

  1. 先观察年化复合收益、最大回撤、年度收益及夏普,确认修改是否带来足够大、而非微小的高层指标改善。
  2. 进一步检查逐年收益和前五大回撤:大多数年份不变,显著变化集中在少数年份,尤其是触发修改的2026年;前五大回撤主要只改善最差那一次。
  3. 返回原策略,单独排除触发重估的两笔交易,发现几乎复制了新规则的主要改善,因此把它视为事后拟合。对于通过上述检查的修改,作者仍等待两三个月再重新判断。

关键结果

原文结果与口径
核对项结果意味着什么
表面改善CAR +5%;夏普 +15%相对改善幅度,不是年化增加5个百分点或夏普增加0.15。
最大回撤变化相对缩小17%改善集中在最差一次,不代表所有尾部风险均下降。
收益来源审计两笔交易解释大部分改善排除个案即可重现效果,是新规则可能缺少一般性的警报。

怎么理解?

这是一种非常实用的“删除个案对照”。研究员往往只展示新规则比旧规则多赚多少,却没有问:如果只删掉让我难受的那两笔,它还能多贡献多少?把这部分先扣出来,能够识别一条规则到底改变了广泛的交易分布,还是只给已知亏损穿上经济逻辑的外衣。 不过,集中在少数事件也不能自动判定规则错误。真正的灾难风控本来就只在少数极端事件上起作用。区别在于是否有事前可辨认、跨事件成立的机制,以及它在未见过的相似事件中是否仍有效。等待两三个月有助于情绪冷却,但若该状态几年才出现一次,等待本身并不构成统计验证。

最大限制

文章是匿名策略案例,未公开全部规则、交易明细和绝对指标,因此不能独立复现17%的回撤改善。作者的等待步骤属于决策治理经验,不是对有效样本量的正式要求。

复现与研究价值

每次修改都记录提出日期、触发交易、原始理由及所有尝试过的替代条件;剔除触发事件后再评价增量效果,并做留一危机事件检验。交易前锁定接受标准,不允许只因最近净值恢复就接受规则。

原文与核查

公开方法与案例正文完整阅读;未取得真实交易流水。

原始文章 ↗

推荐 78/100 · 问题 27/30 · 证据 18/30 · 方法 23/25 · 复现 10/15

个案剔除对照可立即加入研究审核,但匿名策略限制独立复现。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

问卷择时只投资19%的时间,周频回撤不到10%,日频却达到25%

Modeling with the NAAIM Exposure Index

Rob Hanna

一句话先讲结论

作者仅用NAAIM仓位调查设置三种做多条件,触发时持有150%标普敞口,历史只投资约19%的时间;最醒目的不是收益,而是最大回撤用周收盘看不到10%,换成日数据却因2020年3月达到25%。低频估值会藏住持有期内风险,不能据周频表给杠杆策略定风险预算。

它到底在问什么?

主动经理仓位极低可能意味着反弹机会,极高却也可能意味着强势延续;如何把两种不同逻辑写成明确规则,并正确衡量风险?

作者具体怎么做?

  1. 条件一:读数处于过去52周底部10%,但不再低于上周,用于极端悲观后的止跌。
  2. 条件二:读数至少80且四周上升至少15点;条件三:读数至少100,分别表达热度上升和高仓位延续。
  3. 使用周度结果后再用Realtest日价格重算回撤,发现持有期内波动远大于每周抽样所显示的风险。

关键结果

原文结果与口径
核对项结果意味着什么
触发仓位150% SPX不是普通满仓;需要融资、工具与风险约束。
投入时间约19%现金持有减少总体暴露,应与同平均风险基准比较。
回撤频率差<10% → 25%周收盘漏掉周中损失,不能当成两个不同策略的改善。

怎么理解?

这篇最适合做风险报告的反例:同一策略不改交易,只改净值采样频率,就能让最大回撤看起来小很多。持仓和融资面对的是连续市场而不是每周一张截图,日内保证金与滑点甚至可能比日数据还糟。展示周度策略也必须用足够细的价格评估风险。 调查极低和极高都可能对应正收益,提醒我们不能把所有情绪指标机械逆向。可是这三条阈值是否事后选择、是否只是价格趋势的代理,仍需检验。经理仓位往往响应此前市场,加入价格动量后是否还有增量信息,比单独净值漂亮更重要。

最大限制

无佣金、滑点或融资成本;作者明确表示不会仅凭调查持有一整周。未见阈值搜索台账和独立未来样本,问卷平均值也不等于市场总体资金仓位。

复现与研究价值

先重建公开时间戳与日度风险,再加入融资成本;与价格趋势、同平均暴露和简单阈值策略比较。固定三条规则后观察未来,不用新样本继续微调80、100和15。

原文与核查

公开规则与风险说明完整阅读;未下载会员代码或重跑。

原始文章 ↗

推荐 76/100 · 问题 25/30 · 证据 20/30 · 方法 21/25 · 复现 10/15

规则清楚且揭示低频回撤偏差,但无摩擦和阈值选择限制有效性。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

新闻情绪不是一个因子:拆成数字、事件、分析师后,行业方向甚至相反

Sentiment is not one signal

Tommi Johnsen / Svetlana Shasharina

一句话先讲结论

先看后续更正:作者7月审计发现次日收益缺失、周末虚假零收益和分位排序并列处理问题,早期行业收益排名不再成立。5月这篇仍值得读的,是把22261条新闻拆成数字结果、公司事件、分析师动作等渠道,而不是交易当时仅16天估出的巨大收益差。

它到底在问什么?

财报超预期、收购公告、评级上调和泛泛评论为何要放进同一个情绪平均值?如果它们通过不同机制影响价格,汇总标签是否反而抹掉了重要结构?

作者具体怎么做?

  1. 对2026年4月16天、九个行业22261条文章返回类型、material、方向与一句理由,类型占比约71%其他、14%事件、10%数字、5%分析师。
  2. 检查输出约束及同公司同日的跨渠道冲突;22260条满足逻辑约束,发现222个方向冲突案例。逻辑一致并不等于标签事实正确。
  3. 按行业与信息类型计算正负标签日的次日超额收益差,并看分布而非仅均值;各组中位数普遍接近零、分布重叠,少量尾部观察推动平均差。

关键结果

原文结果与口径
核对项结果意味着什么
信息分类样本22261条 / 16天早期提示词与语料的工程记录,不代表收益检验有效。
历史行业收益表后续更正,不再成立不得用原文−2.4或+2.4个百分点等数值给行业择时。
更正后的次日信号未显著区别于零作者7月修正数据与无并列歧义指标后,未确立稳定模型排名。

怎么理解?

这种拆法的研究价值在于让假设有明确经济对象:数字结果可围绕预期差,事件可围绕金额和业务影响,分析师动作可围绕首次调整与目标变化,而不只是一个通用正负分数。行业之间确实可能通过不同渠道吸收信息,但需要更长的未来验证来决定哪些差异稳定。 最需要刹车的是把九行业乘三渠道的结果表直接变成选股规则。单元格越多、样本越短,越容易找到几个很大的均值;同一公司多条新闻、同一交易日宏观冲击也让观察不独立。文章把某些行业现象解释为分析师更有价值或信息已定价,这些是合理假说,不是当前设计识别出的因果关系。 后续核验改变了本篇的结论等级:作者7月不只说样本不足,而是发现原始测量有缺陷,行业排名未通过复核。因此这里保留分类思路作为研究设计,不保留早期收益表作为有效经济证据。

最大限制

重要后续更正:次日收益列只覆盖约一半日期,周末填充产生虚假零,分位排序受大量并列值影响;作者已撤回稳定次日收益和行业排名声称。本篇旧数据只用于解释研究演变,不能作为当前策略证据。

复现与研究价值

冻结类型定义后,新增事件金额/市值、预期差和首次发布时间;按公司与日期聚类评价,设置真正后续季度样本。先报告渠道标签一致性和条件分布,再决定是否需要行业专属参数。

原文与核查

公开正文、提示词和分布解释完整阅读;未重跑原始新闻模型。 已阅读7月更正正文,旧收益结论已降级并标注。

原始文章 ↗

作者7月更正:原有收益结论撤回

推荐 68/100 · 问题 28/30 · 证据 10/30 · 方法 21/25 · 复现 9/15

信息类型拆分仍有工程价值,但收益与行业排名已被作者后续审计推翻。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 论文导读

没持有比特币,也可能持有同一批投机者:关注因子是在找隐藏共振

The Attention Factor: The Link That Connects Crypto and Public Equity Markets

Harin de Silva;Quantpedia导读

一句话先讲结论

论文导读称,在投机活跃时期,比特币约四分之一短期收益变化与全球股票共同变化;扣除市场和风险偏好后,剩余联系集中在Coinbase、Robinhood、DraftKings及情绪型ETF,而纳指100等基准大幅减弱。要问的不是组合有没有币,而是是否反复暴露于同一类投机参与者。

它到底在问什么?

没有共同现金流的市场为何同步波动?普通市场Beta能否解释全部联系,还是跨平台交易的同一群边际投资者带来额外共同风险?

作者具体怎么做?

  1. 观察比特币与全球股市连通性的时间变化,重点比较投机参与高低阶段,而不把一个全样本相关系数当常数。
  2. 剔除共同市场与风险偏好通道后,比较不同股票和ETF的剩余联系,检查其是否与投资者构成及商业模式对应。
  3. 用情绪ETF和去趋势0DTE交易量作补充验证;导读引用相关系数0.30、p<0.001,但这仍是共同变化证据,不自动识别同一群投资者的因果传导。

关键结果

原文结果与口径
核对项结果意味着什么
高投机期共同变化约25%文中连通性口径,不宜直接替换成所有时期固定回归R²。
剩余联系股票之间明显不同商业暴露与参与者结构可能重要,并非所有热门科技股都同样敏感。
0DTE佐证r=0.30相关性支持进一步研究,但不证明同一资金群体造成了全部联系。

怎么理解?

这篇对组合风险的提醒比对收益预测更成熟。跨资产分类常按证券形式划分,但真正的风险源可能是共同融资约束、投资者情绪或参与热度。一个组合同时买交易平台、博彩平台和高关注股票,形式上跨行业,行为风险却可能高度集中。 不过,剔除几个市场因子后留下相关性,不等于找到了唯一遗漏因子。共同政策、融资条件、风险偏好代理误差和商业收入渠道,都可能产生残差。尤其交易平台公司本身的收入确实与市场活跃度相关,不能把所有关联都视为纯粹没有基本面的注意力传染。

最大限制

本次完整阅读导读与其引述摘要,原论文全文未独立取得;不采用无法核对的表格描述和缩写解释。显著相关不等于因果,尚未提供可复制的实时因子、净收益或稳定对冲结果。

复现与研究价值

在现有组合中先做残差暴露与压力归因,再分别控制交易量敏感收入、融资条件和传统风格;使用时间外检验确认负载是否持续,避免把新的残差名字直接加入风险模型并给予因果含义。

原文与核查

公开导读完整解析;原论文全文未逐页核验。

原始文章 ↗

原论文SSRN6277718

推荐 71/100(暂定) · 问题 28/30 · 证据 17/30 · 方法 21/25 · 复现 5/15

隐藏风险问题重要,全文、因子构造及识别仍待核验。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

五月首日上涨后,25次中17次四日后下跌:季节性线索还不是交易策略

A Strong Start to May Has Often Been Followed by a Short-Term Dip

Rob Hanna

一句话先讲结论

自1987年以来,五月第一个交易日上涨的25次样本中,17次在四天后收低,约占68%;但其中一次包含2010年闪崩,作者本人也不把它作为独立交易理由。频率倾向可以提示短期风险,却不能替代平均收益、尾部损失与成本检验。

它到底在问什么?

月份开头的强势是否一定延续,还是五月这一日历位置存在短期回吐倾向?当多个季节性和价格信号相互矛盾时,应给这个条件多少权重?

作者具体怎么做?

  1. 作者回看1987年以来五月首日上涨的历史实例,统计四天后相对起点是否走低。
  2. 检查累计结果路径,指出一笔巨大下行发生在2010年闪崩附近,提醒单事件可能影响总收益观感。
  3. 同时考虑当时其他多空研究信号,因此把该现象定位为背景倾向,而非单独开仓依据。

关键结果

原文结果与口径
核对项结果意味着什么
方向计数17/25历史条件频率,样本稀少且未调整日历规则搜索。
重大尾部事件2010年闪崩收益强度可能被极端观察影响,需要同时报告剔除前后与稳健统计。
净收益结果未报告公开文字不足以计算可执行空头策略的净收益和风险。

怎么理解?

最有用的审阅问题不是68%够不够高,而是这条规则为什么被拿出来。日历日期、首日方向和四天持有期都可能来自大量尝试;若没有试验台账,25个观察里偏离50%的频率很难自动构成新的效应。置信区间和未参与选择的未来年份比漂亮历史胜率更关键。 同时,方向胜率不会告诉你盈亏比。少数上涨日可能幅度更大,卖空还要承担成本与跳空;去掉2010年后仍“看起来偏弱”不等于已经有稳健净收益。作者没有夸大为独立策略,这种边界应在看板上保留。

最大限制

短篇公开研究没有完整收益表和交易规则;仅25个条件实例,未独立核验原图或逐日行情,也未给多重比较调整。

复现与研究价值

把规则原样登记后观察后续年份;在历史审计中同时报告均值、中位数、最差反向行情及删除单事件敏感性,并与其他月份同定义规则比较,不再继续挑最佳日期。

原文与核查

公开短文完整阅读;未独立转录图表或回测。

原始文章 ↗

推荐 53/100 · 问题 17/30 · 证据 14/30 · 方法 13/25 · 复现 9/15

短线背景线索清楚,但小样本和规则搜索限制交易意义。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

22条加密策略纸面前测16条亏损,但“累计−2081%”并不是账户收益

I paper-traded 22 popular crypto strategies on real fees for 10 days. Here's the data.

StratProof / Patrick Mortenson;文章注明由Claude撰写

一句话先讲结论

平台报告22条策略十天纸面前测26765笔交易,16条净亏,平均每笔−0.078%;但标题式“累计−2081%”只是逐笔百分比加总,不能当成账户跌幅,文中另列1000美元变662.90美元。它最值得读的是成本与信号家族集中风险,同时也必须审计文章自己的统计口径。

它到底在问什么?

常见技术指标在加入交易费和盘口价差后是否还能盈利?看似不同的六条胜者,是多种独立策略,还是同一个均值回归信号的参数变体?

作者具体怎么做?

  1. 从2026年4月19日开始十天前测,将22条技术策略的结果按策略、周期与币种分解,并加入平台自述的手续费和L2价差模型。
  2. 发现六条盈利策略均属于RSI均值回归家族,而不是六种独立优势;作者进一步给候选池加家族分类和容量上限。
  3. 比较回测与前测差异,报告胜率偏差、止损穿透与滑点校准,同时公布方法规范;核心回测引擎仍未开源。

关键结果

原文结果与口径
核对项结果意味着什么
总体平均每笔−0.078%跨策略交易样本平均,交易并不独立,也不是每日组合收益。
模拟账户余额1000 → 662.90美元与加总收益指标不同;具体资本分配和净值对账仍需公开流水核验。
盈利家族六条均属RSI类参数数量不等于风险分散度,六个名字可能同涨同跌。

怎么理解?

这是一个适合训练研究审计的案例:作者愿意讨论成本与失败,但“使用真实费用”并不会自动让模拟变成真实可成交业绩。被动单排队、成交概率、盘口更新延迟、资金占用与市场冲击仍可能遗漏。纸面模型需要用真实成交验证,而不只是用自己的另一组假设校准。 文章本身还有值得警惕的口径问题:宣称十个币种却列出更多名称;不同段落的单边价差与往返成本不完全吻合;低周期交易数更多也不意味着大数定律自动带来优势。这些不推翻成本重要性,却意味着不能照抄它的胜者排名或“长周期更差”的解释。研究员应把可验证账本与营销性概括严格分开。

最大限制

仅十天、多个相关策略和重叠交易,无法支持长期有效性。核心引擎未公开,费用表、滑点及账户净值未独立核验;文章由AI撰写并由运营者事后审核,不能视为独立第三方测试。

复现与研究价值

先对逐笔名义本金、手续费、价差、已实现损益和账户权益做恒等对账,再冻结规则延长前测。按信号家族报告收益相关性和有效多样性,并将真实成交、纸面成交与回测成交逐笔匹配。

原文与核查

公开文章、方法脚注与作者披露完整阅读;未独立验证平台账本或访问账户。

原始文章 ↗

推荐 58/100(暂定) · 问题 24/30 · 证据 10/30 · 方法 17/25 · 复现 7/15

失败披露与家族风险值得看,但统计口径和模拟实现问题明显。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

风险平价最痛的月份不是普通坏日子的简单累加:股债共跌占比明显上升

Where Risk Parity Hurts: A 58-Year Audit of Tails and Drawdowns

Beyond Passive Investing

一句话先讲结论

把股、长债、黄金逆波动组合延长到1968年后,作者找到721个最差5%交易日,平均跌1.04%;换成月频,35个尾部月份平均跌4.40%。其中股债共同下跌的类型从日尾部的14%升到月尾部的23%,说明组合的长期伤害不只是一次闪崩,而可能来自持续的共同宏观暴露。

它到底在问什么?

同样约20%的回撤,究竟由什么资产、以什么速度造成?如果不先拆清楚失败模式,就很难知道新增策略是在填补风险缺口,还是仅提高全样本平均收益。

作者具体怎么做?

  1. 在约14,400个交易日里选择最差5%的721日,计算平均尾部损失并根据股、债、金当天涨跌分组。
  2. 对694个月同样选最差5%的35个月,比较资产共跌类型和历史聚集区间,区分急性冲击与持续状态变化。
  3. 另外列出六个最大峰谷回撤期间的资产表现,观察1968—70、1972—74、1983—84、1987、2008、2022等时期的差异,再讨论潜在补充策略的目标。

关键结果

原文结果与口径
核对项结果意味着什么
日尾部平均损失−1.04%最差5%日期的平均值,不是每天预计亏损,也不是最大单日跌幅。
月尾部平均损失−4.40%35个历史尾部月份平均,样本之间可能属于同一危机、并非独立观察。
股债共跌类型占比14% → 23%日尾部与月尾部分类占比的变化,显示持续风险结构与单日冲击不同。

怎么理解?

这篇值得研究员借鉴的是“新增策略对着缺口设计”的顺序。一个与核心组合全样本低相关的策略,未必在核心最痛的时候赚钱;先列出不同失败状态,再检查候选在这些状态的实际贡献,更接近风险预算的目标。特别是长债和黄金的利率敏感性,在某些宏观变化中可能同时暴露,资产名字不同不代表风险源独立。 但分类本身用了已经发生的资产收益,只能做事后诊断,不能直接用作当时可交易的状态标签。把历史最差窗口选出来,再反复寻找恰好赚钱的补充策略,会产生新的尾部过拟合。尾部样本少而且聚集,六段危机并不能支持精细到许多状态的最优配置。

最大限制

1968年以来序列含合成历史,黄金早期可投资性尤其重要;最大回撤发生在黄金尚不可按现代方式持有的阶段。文中尾部归因是观察性分析,未验证预测规则或新增策略的样本外收益。

复现与研究价值

先锁定日尾部、月尾部的审计定义,再用留一危机时期检验候选补充策略,报告成本、资金占用和非危机拖累;保留合成历史与真实ETF时期两套结果,不让前者掩盖实际可交易区间。

原文与核查

公开正文完整阅读;未取得或重算底层合成日序列。

原始文章 ↗

推荐 81/100 · 问题 28/30 · 证据 21/30 · 方法 23/25 · 复现 9/15

尾部归因细致、设计顺序有用,合成历史及事后状态限制可交易推断。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 方法说明

隐含波动率“几乎显式”公式并不等于更快:尾部测试慢了一个数量级

Almost Explicit Implied Volatility

Fabien Le Floc’h

一句话先讲结论

利用逆高斯分布分位数求Black–Scholes隐含波动率,公式看起来简洁,数值精度也接近机器精度;但作者的变行权价测试里,Julia默认实现用时1704微秒,Jäckel算法只需154微秒。把求根藏进一个分位数函数,不会自动消除迭代成本,“显式”不是速度保证。

它到底在问什么?

新的隐含波动率表达式能否在实际定价管线里取代成熟算法?比较重点不只是公式是否简短,而是深度虚值等困难区域的精度、耗时和稳定性。

作者具体怎么做?

  1. 先通过看涨看跌平价与归一化把输入价格转成统一形式;近似平值时使用正态分位数,其他情况调用逆高斯互补分位数得到波动率。
  2. 第一组固定远期100、行权价200、期限1年,让波动率从0.02到4.0,形成399个样本,比较波动率和重定价误差。
  3. 第二组固定波动率10%,把行权价从100改到500,专门观察更深虚值区域;同时比较两种逆高斯分位数实现,以区分数学表达与底层库的性能。

关键结果

原文结果与口径
核对项结果意味着什么
固定行权价批次104 vs 246 μsJäckel与默认逆高斯实现;精度相近,但后者约慢一倍以上。
变行权价批次154 vs 1704 μs默认逆高斯实现约慢11倍,说明尾部路径可能触发昂贵计算。
替换分位数实现288 μsstatsmod移植版改善很多,瓶颈不应简单归咎于数学变换本身。

怎么理解?

这篇提醒我们把数学简洁性和计算复杂度分开。调用一个特殊函数并不意味着它的成本为常数,实际库可能在困难参数区间反复迭代。量化系统里更应该看分布尾部延迟和失败率,而非只在平值、正常波动率附近跑平均速度。 另一个值得借鉴的设计是双层归因:同一数学方法换底层实现后,性能明显改变。这能避免把库实现缺陷误写成算法本身不行,也避免因某一次漂亮基准便替换成熟求解器。机器精度级波动率误差已远小于常见报价粒度,是否值得进一步追求精度,需要结合下游希腊值和校准需求判断。

最大限制

只是两组特定网格的Julia测试,不覆盖全部到期时间、负利率、极端贴现因子、边界价格和所有硬件;原文提到新论文与旧实现的历史渊源,但本文未独立审核其全部学术优先权。

复现与研究价值

在真实报价清洗后的输入分布上加入极小价格、接近上界、超短期限等压力集,记录最大重定价误差、分位耗时和失败案例;与成熟实现交叉验证,再决定是否进入生产。

原文与核查

博客全文、代码及两张数值表已读;未运行Julia基准。

原始文章 ↗

推荐 83/100 · 问题 24/30 · 证据 24/30 · 方法 23/25 · 复现 12/15

明确网格、代码和误差口径,直接揭示特殊函数实现的性能陷阱。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

追最近最赚钱的策略:绝对收益更高,但风险调整后没有增加价值

Selecting TAA Strategies Based on Recent Performance (Part 1)

Allocate Smartly

一句话先讲结论

从 100 多个战术配置策略中,每月选最近收益最高的几个,1973 年以来的测试显示绝对收益普遍超过平均策略;但夏普和回撤调整指标没有显著优势,选前 1—2 名的回撤尤其差。更关键的是,结果还没扣在策略之间换仓的额外成本:看起来是在选赢家,实际上很可能主要选中了风险更高的策略。

它到底在问什么?

既然不同配置策略轮流占优,能否在策略之上再套一层动量,持续买近期最好的那几个?这里选的不是股票,而是完整策略的历史收益曲线。

作者具体怎么做?

  1. 每个月末计算平台 100 多个 TAA 策略过去 X 个月收益,选前 Y 个,等权持有下一月。比较不同回看长度与入选数量。
  2. 先看年化收益,再看夏普、最大回撤,以及同时考虑回撤深度和持续时间的 UPI。不同指标用来区分收益增加与风险增加。
  3. 单个策略历史已计入自身交易摩擦,但本层从策略 A 切换到 B 造成的额外买卖没有加入。这是第二层组合成本,不会因为底层已经算过成本就自动消失。

关键结果

原文结果与口径
核对项结果意味着什么
候选策略池100+今天平台跟踪的策略集合;并不等于 1973 年投资者已知道所有这些策略。
尤其脆弱的选择前 1—2 名集中追近期赢家失去策略分散,正文指出回撤不佳。
风险调整后增量未显示显著优势这是本文收益排序设置的结论,不能外推到所有策略选择方法。

怎么理解?

它和股票动量一个重要区别,是策略池里的风险尺度并不一致。股票收益排名也有波动偏差,但这里从保守配置到激进集中策略,风险差距更大。近期收益领先可能只是某段行情奖励了更高 Beta,不是经理能力突然增强。 另一个值得用于实际组合管理的教训是成本分层。底层策略各自回测净收益正确,不代表把它们轮动起来后的净收益正确;真正要交易的是合并后的证券头寸。换两个高度重合策略可能成本较低,换完全不同资产配置则可能很高,必须在净头寸层计算,不能统一忽略或重复收费。

最大限制

本次只核对公开文字,图中完整网格数字未转录。当前策略库回溯到 1973 年有策略发现时间与筛选偏差,作者没有在本文证明这是历史真实可选策略池。结论是未发现增量,不是数学上证明所有业绩选择都无效。

复现与研究价值

做自有策略看板时同时显示原始收益排名和统一波动后的排名;以全部策略等额风险组合为基准,补上策略发布后才可入池的验证。若二层择时在计入净头寸成本后仍不能胜过简单平均,应保留分散,而不是再优化更多回看窗口。

原文与核查

已读公开正文与指标解释,未逐图转录全部网格、未执行平台回测。

原始文章 ↗

推荐 82/100 · 问题 28/30 · 证据 22/30 · 方法 23/25 · 复现 9/15

负面结果与二层成本提醒直接影响策略组合决策;历史可用策略池和完整网格仍需审计。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 观点评论

让 AI 多跑一千次回测,并不会自动增加对市场的理解

For The Love of The Game

Kris Longmore

一句话先讲结论

作者把“自己试到一条好曲线”和“让 AI 替自己试到一条好曲线”视为同一个问题:提高搜索速度,却没有回答收益为什么持续。这篇值得读的不是反对 AI,而是提醒研究员:多重检验修正只能约束统计假阳性,不能单独证明策略背后存在会继续运转的经济机制。

它到底在问什么?

自动生成代码和回测后,量化研究最稀缺的能力变成什么?作者认为是理解市场参与者的约束,而不是继续增加模型和试验数量。

作者具体怎么做?

  1. 先寻找可能反复出现的约束性交易,例如配置组合再平衡、永续合约杠杆需求,而不是直接枚举价格规则。
  2. 把机制写成可观察的预期,再检查交易流、时间窗口与收益变化。回测用于验证如何把机会转成可执行组合,不应替代机制本身的研究。
  3. 区分统计证据和持续性解释:记录所有试验并校正显著性有用,但不能由此跳到未来仍然赚钱。研究应积累对市场行为的理解,而不只积累回测数量。

关键结果

原文结果与口径
核对项结果意味着什么
材料性质观点与方法评论没有新收益或因果识别结果,不能把语气强烈当证据充分。
多重检验能够帮助控制假阳性需要有效的检验假设;不保证经济机制持续。
AI 的流程价值取决于研究目标速度既能帮助检验,也能加快过拟合,本文没有量化两者的净效应。

怎么理解?

我赞同把回测当作压缩后的结果,而不是所有研究信息。一个信号即使最终组合没赚钱,原始预测关系也可能存在,只是被交易成本或仓位规则抵消;反过来,组合赚钱也可能只是承担了更多风险。保留逐事件证据和交易账本,会比只存一张净值图更有帮助。 但原文“每一笔利润都来自对手方亏损”的表述不能覆盖所有投资收益。风险补偿、企业现金流和不同参与者的对冲效用,使双方都可能从交易获得价值。因此更准确的问题是“我提供了什么风险承担、流动性或信息服务”,而不是必须找出一个长期输钱的人。机制解释和统计纪律应相互补充,不能拿故事替代数据。

最大限制

没有受控证据证明机制驱动流程一定优于所有数据驱动研究。作者既表达个人经验也推广课程,读者应分开评价。来源网页日期晚于目录收录日,保留原值并注明,不把日期差异改造成确定的首次发表日。

复现与研究价值

把 LLM 的下一步任务从“继续提高夏普”改成“列出当前结果的三种替代解释,并设计最便宜的区分实验”。数据库同时保存失败试验、条件收益和仓位归因,策略失效时才有依据判断是机制消失还是正常噪声。

原文与核查

公开正文已读;观点评论,无新增回测可核验。

原始文章 ↗

推荐 68/100 · 问题 25/30 · 证据 11/30 · 方法 23/25 · 复现 9/15

流程反思有帮助,但缺少新实证且有绝对化表述;适合作为团队讨论材料,不是策略背书。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

做空标普尾部成分失败;反过来做赚了钱,却还不能证明是指数资金效应

When Big Gets Small: Trading the Lower Tier of Large Caps and Upper Mid Caps

David Belobrad / Quantpedia

一句话先讲结论

作者原本想做空标普 500 最小的成分股,赚它们可能被剔除后的卖盘压力;分别做空 5、20、50 只都没有找到稳健优势。反过来买最小的指数内公司、卖最大的指数外公司后,20 对 20 的设置报告年化约 11.23%,但夏普仍只有约 0.4。这个结果更像值得继续拆解的相对收益现象,尚不是已经识别清楚的“被动资金 Alpha”。

它到底在问什么?

被动资金越来越大,能否提前利用指数资格带来的买卖盘?如果不知道未来谁被剔除,用指数内部市值最小的公司作为候选,是否足够接近真正的资金事件?

作者具体怎么做?

  1. 在 QuantConnect 框架中按季度末市值排序,先做空指数内最小的 20 家,再把数量改成 50 和 5;这些设置都没有支持稳定的剔除压力收益。
  2. 加入相对价值对照:买入最大的非标普公司、做空最小的标普公司,比较每边 50、20、10 家。作者仍未发现令人信服的改善。
  3. 将方向倒转,买指数内最小公司、空指数外最大公司;再测试两边数量相等和不相等的组合,观察股票数量与分散程度的影响。
  4. 原文报告 20 对 20 配置年化约 11.23%,风险调整后夏普约 0.4,其余相关配置多在 0.3—0.4。作者承认逐步调数量已经包含参数选择,并查看附近设置是否有相近表现。

关键结果

原文结果与口径
核对项结果意味着什么
最初的剔除风险交易未获稳健支持不能凭接近指数尾部,就视作拥有确定的剔除时间和卖盘信息。
反向 20 对 20 组合约 11.23%/年作者回测年化,公开文字未充分披露净成本、融资与借券口径。
风险调整效果夏普约 0.4原始收益看起来较高,但并未明显超过附近构造的风险效率。

怎么理解?

我认为最值得注意的并不是把失败信号反过来交易,而是代理变量到底代理了什么。标普资格不是一条纯市值门槛:如果指数内外公司在盈利、流动性、行业和上市历史上不同,多空收益可能来自这些差异,而不是被动资金持续推高成分股。要讲“指数会员溢价”,先得把这些替代解释压下去。 另一个警示是研究路径本身:从做空、换数量、加多头,到反转方向再改配比,试验空间一直扩张。附近参数表现接近比孤立尖峰好,但所有变体仍来自同一段历史;这不能替代冻结规则后的样本外检验。正反策略也可能因现金、融资和敞口设定不同而不是严格镜像,必须核对交易账本。

最大限制

公开文字未给出完整回测日期、时点成分实现、证券筛选与借券费用,本文未从图中臆造缺失数值。原文有一处对原始多空方向的文字表述不一致,本文按相邻图注与方法段理解;复制前仍须以代码为准。没有因子中性化或准实验设计,不能宣称已证明被动资金因果机制。

复现与研究价值

优先做市值、行业、盈利和流动性匹配,再分别研究指数公告日、生效日以及平时持有期;把市场 Beta、借券不可得和总杠杆统一。A 股迁移应使用各指数当时的准入与调整规则,不直接照搬标普排序;先检验匹配后的条件收益,再谈交易组合。

原文与核查

公开方法和结果文字已读;未逐图转录或执行 QuantConnect 回测。

原始文章 ↗

推荐 70/100 · 问题 26/30 · 证据 17/30 · 方法 19/25 · 复现 8/15

负面结果和方向反转有启发,但资金机制尚未识别,成本与历史成分口径不足。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 论文导读

事实没变,FinBERT 却改口:97.2% 的分类准确率经改写攻击降至 71.0%

How to Break a Financial Sentiment Model Without Changing What It Means

Tommi Johnsen;原论文 Aysun Can Turetken / Markus Leippold

一句话先讲结论

保持财务事实和情绪含义不变,只用 GPT-4o 改写句子,导读报告 FinBERT 在 Financial PhraseBank 上的准确率由 97.2% 降到 71.0%,FinGPT 由 99.2% 降到 78.5%。但这不是说日常新闻有三成必然被误判:作者是在每句多个候选改写里挑选更容易攻击目标模型的版本,测到的是抗攻击能力,而非自然分布下的平均错误率。

它到底在问什么?

金融情绪模型到底学会了经济含义,还是依赖“增长、下降、损失”一类词语线索?同一事实换一种正常说法就改变交易方向,会让新闻因子的稳定性和安全性同时出问题。

作者具体怎么做?

  1. 导读介绍的攻击先用 GPT-4o 为每个输入生成 25 个候选改写,要求保留信息和情绪方向,不直接修改公司财务事实。
  2. 候选按参考语义空间与目标模型空间的相似度差异筛选,再对靠前候选检查语义是否保留。这个选择步骤有意寻找“人看着一样、目标模型表示却变了”的句子,不能把它当随机同义改写实验。
  3. 在 Financial PhraseBank、TFNS、SEntFiN 三类金融情绪数据上攻击 FinBERT、FinGPT,比较预测标签改变率和准确率下降。期刊摘要确认跨设置预测改变约 20%—54%,准确率下降约 10—26 个百分点。
  4. 导读归纳数值比较缺少方向词、双重否定、触发词多义等错误类型。它们有助于设计压力测试,但不能由少量案例推导所有新模型都能正确理解金融语义。

关键结果

原文结果与口径
核对项结果意味着什么
FinBERT:FPB 准确率97.2% → 71.0%下降 26.2 个百分点;详细数字来自本篇导读,未逐表核对期刊全文。
FinGPT:FPB 准确率99.2% → 78.5%下降 20.7 个百分点;不能把相对较小下降解释为交易系统已经安全。
原论文摘要范围20%—54% 标签改变不同模型和数据集的攻击结果范围,不是日常新闻误判概率。

怎么理解?

对量化研究员,这比“换一个更大的模型”更具体:如果因子建立在经济含义上,那么句子不改意思,信号就不该大幅漂移。可以把原句及其多种表达视作同一经济事件,研究标签、置信度和最终仓位的一致性,把语言不稳定造成的换手单独记账。 但攻击成功也不等于策略必然亏损。标签从正变中性和从正变负,对仓位的影响不同;错误是否集中在真正有信息的新闻,比总体翻转比例更重要。评估应延伸到事件层和组合层,而不能把分类误差直接乘上资产规模宣称金融损失。

最大限制

本次读完公开导读,并查到期刊摘要及 SSRN 地址;出版社全文访问返回 403,尚未逐表核对攻击参数、人工等价性验证与代码。文中细项明确按导读报告,不冒充原论文全文审计;数据集微调重合和对抗性挑选也限制了对真实新闻的外推。

复现与研究价值

给现有新闻因子加入冻结的语义一致性测试集:保留金额、比较期与公司主体,分别测试数字重排、否定句、转折和多公司标题;独立人工检查语义未变,再统计信号翻转与交易换手。训练增强与测试改写必须分开,防止把同一批攻击样本反复调到高分。

原文与核查

公开导读完整解析;原论文摘要与书目信息核对,期刊全文未取得。

原始文章 ↗

原论文:Journal of Banking & Finance

作者工作论文:SSRN 4977483

推荐 82/100(暂定) · 问题 29/30 · 证据 21/30 · 方法 23/25 · 复现 9/15

压力测试问题直接相关,期刊摘要可核实总结果;详细表格和完整攻击实现仍需核验。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 方法说明

Lazy Prices 的 22% 是旧论文结果,不是把年报接入大模型后的新 Alpha

Lazy Prices, Lazy Investors - and the 22% Alpha Hidden in 10-Ks That Nobody Reads

Quantt;原论文 Lauren Cohen / Christopher Malloy / Quoc Nguyen

一句话先讲结论

这篇标题中的“22% Alpha”来自 Lazy Prices 原论文的特定组合结果:买年报变化少的公司、卖变化多的公司,月度 Alpha 最高约 188 bp;不是作者用 Snowflake 和大模型重新回测得到的 2026 年收益。文章真正的新内容是工程流程提案,而把词频相似度换成语义向量,已经改变了信号,不能视为原策略的无损复现。

它到底在问什么?

公开年报里新增和修改的风险信息是否被市场慢慢消化?如果过去难在清洗、配对、比较大量申报文件,现在数据平台与 LLM 降低工程成本后,还剩哪些真正困难?

作者具体怎么做?

  1. 原研究方向是配对年度或同季文件,以余弦、Jaccard、编辑距离及词语差异等方法衡量改动,再按相似度排序比较后续收益。期刊摘要确认最高月度 Alpha 188 bp;这一上限不等于所有定义和加权方式都达到同一收益。
  2. Quantt 提议在数据平台读取已经按 Item 拆分的 SEC 文件,生成向量,并将同一公司、同一章节、相邻财年的记录连接起来,计算向量余弦相似度。
  3. 再把相似度、收益和财务变量组织成语义视图,让分析员用自然语言查询组合表现。文中 SQL 包含省略号与示意定义,是架构草图,不是已验证可运行的完整研究系统。
  4. 作者也承认嵌入与原始词频指标不等价,建议并行保留传统度量。本文没有提供这套新流程的完整回测、模型版本冻结、样本外收益或成本验证。

关键结果

原文结果与口径
核对项结果意味着什么
原论文最高月度 Alpha188 bp/月约 22.56% 的线性年化口径;不是本篇 2026 年新测得的可投资净收益。
新语义向量流程收益未报告本文展示提案,未报告完整复现结果,不能把旧数字移植过来。
发表年份纠正2020 年出版页首次发表为 2020-01-28;博客使用的 2019 年说法不能替代正式出版信息。

怎么理解?

对研究员最有价值的实验,恰好在两个相似度不一致的地方。把“字面变化大但意思不变”和“字面变化少但风险含义改变”分开,才能回答收益究竟来自阅读成本、真实基本面变化,还是报告模板更新。直接换成更先进的表示并沿用旧 Alpha,反而跳过了最重要的测量验证。 工程上也不能把两段 SQL 当成完成数据治理。示例只按财年配对 10-K/10-Q,未完整约束报告类型、同季度和修订版本,可能产生一对多连接;按 filing_date 分组也不天然等于月度可交易横截面。财年结束、申报公布和数据库入库是三个不同时间,任何一个用错,都足以让自然语言查询流畅地给出错误答案。

最大限制

已读本文并核对原论文出版摘要,未在此完成 45 页原论文及代码审计。本文对 Alpha 长期存活和一天搭完基础设施的判断没有相应实证;还包含平台和培训推广。向量模型的发布日期、截断长度与成本也没有被纳入其历史实验,因为本文并未执行该实验。

复现与研究价值

先建立逐文件时点审计,再用同一股票池、同一交易时点比较词频、字符改动、章节语义变化三组信号;保留原论文发表后的独立测试期。A 股可以研究风险提示、MD&A 和前后版本差异,但先清除模板修订和格式变化,并与首次业绩预告信息去重。

原文与核查

公开文章完整解析;原论文摘要及出版信息核对,未重跑原论文。

原始文章 ↗

原论文 Lazy Prices(Journal of Finance,2020)

推荐 77/100 · 问题 28/30 · 证据 17/30 · 方法 22/25 · 复现 10/15

研究问题和测量差异值得读,代码草图有教学价值;没有新 Alpha 验证,不能按标题分数背书。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

58 年股债金配置:波动可预测,不代表逆波动权重就是风险平价

Revisiting Beyond 60/40: Five Decades of Risk-Weighted Allocation

Beyond Passive Investing

一句话先讲结论

作者把股票、长债和黄金的回测向前拼接到 1968 年:股债 120 日滚动相关性的均值只有 +0.06,但约 61% 的时间仍为正,说明不能把过去二十年的股债负相关当永久保险。其组合用 63 日波动率定月度权重,组合波动超过 8.5% 时缩仓到 8% 目标;防御效果值得研究,却不能把“加黄金、重新配权、降低仓位”三种贡献混成一个 Alpha。

它到底在问什么?

传统 60/40 的分散效果是否依赖特定宏观时期?如果股债可能一起跌,加入黄金并根据波动调整仓位,能否让承担风险的路径更稳定?

作者具体怎么做?

  1. 2005 年之前用黄金定盘价、股票总回报重建序列和由 FRED 收益率构造的长债序列,按比例衔接到现代 ETF;2005 年之后主要用 ETF 价格。整体覆盖约 58 年,但可交易工具和历史构造方式并不相同。
  2. 每月末用过去 63 个交易日的实现波动率计算逆波动权重:波动越高,资金权重越低。全期目标权重均值大致为股票 34%、长债 35%、黄金 31%。
  3. 每日检查组合过去 63 日波动:超过 8.5% 时缩减风险资产敞口,使估计波动回到 8%;否则保持全额投资,不加杠杆。现金按当时联邦基金利率计息,不能假设减仓现金收益为零。
  4. 作者检查过去 63 日波动对未来 21 日波动的解释力,报告整体约 40%,不同年代大致 0.2—0.5;另以单资产 5% 目标波动比较资产,那个演示允许杠杆,与主组合规则不同。

关键结果

原文结果与口径
核对项结果意味着什么
股债滚动相关性+0.06;61% 为正历史 120 日滚动统计;接近零的均值掩盖了长期正负相关状态切换。
波动覆盖层规则8.5% 触发 → 8% 目标阈值是作者选择的风险预算,不是检验所得的唯一最优值。
黄金累计收益金额贡献约 38%不是平均权重、年化收益贡献,也不能拿它直接证明未来边际分散收益。

怎么理解?

文章里需要修正的一个概念是“逆波动等于风险贡献平衡”。逆波动只让各资产的单独波动预算接近,实际组合边际风险还取决于相关性;当股债共同上涨下跌、黄金较独立时,资金按 1/波动率分配并不自动形成风险平价。恰恰因为本文强调相关性不稳定,这个区别不能略过。 波动有持续性确实能支持风险管理,但波动预测的 R² 不是收益预测力。缩仓也可能在冲击发生后兑现损失、错过反弹;目标 8% 不是实现波动的保证。真正有说服力的归因应分别加入黄金、改逆波动权重、加现金覆盖层,再把各版本调整到同一实现风险进行比较。

最大限制

合成长债涉及久期、票息与滚动假设,乘法衔接只统一价格尺度,不保证历史收益和真实可投资组合相同。完整主表数值位于图中,本次未逐图转录,故不编造精确 CAGR 或最大回撤。原文对未来现金利率及季节性叠加低相关的判断不是已证明事实。

复现与研究价值

复现时先分“真实 ETF 期”和“合成长历史期”报告,公开每条拼接规则;再做四层消融:60/40、等权股债金、逆波动股债金、逆波动加覆盖层。固定一组合理波动参数做敏感性检查,记录冲击后减仓与反弹缺席成本,避免只用全期净值评价风控。

原文与核查

公开正文、规则与文字统计已读;图内完整绩效表和合成代码未独立核验。

原始文章 ↗

推荐 77/100 · 问题 27/30 · 证据 20/30 · 方法 21/25 · 复现 9/15

长期状态对照和清晰仓位规则有用;合成历史、风险平价表述及归因对照仍有限。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 论文导读

动量跳过最近一个月:行业组合中,它放大了状态差异,而非稳定改善收益

The Skip-Month Mystery: What Last Month’s Returns Are Really Telling You

Larry Swedroe;原论文 Dibyam Dikhit

一句话先讲结论

在1975—2024年48个美国行业中,每月买入过去表现最好的5个行业:跳过最近月的12–1策略,在稳定趋势状态月均赚2.32%,压力状态只有0.94%;不跳月的12–0对应1.86%和1.35%。但两策略的“稳定”月份分别只有156和208个,并非同一组市场日期。这篇揭示最近月有诊断价值,却还没有证明按这张表切换策略就能获得样本外优势。

它到底在问什么?

为了避开短期反转而删去最近月,是否也删掉了识别行业趋势已经变化的重要信息?

作者具体怎么做?

  1. 用French的48个价值加权行业日收益,复合成月收益,每月开始重新排名;基准为48行业等权。原始数据从1974年起,为1975年持仓提供形成窗口。
  2. 对所选行业组合比较最近月收益与之前11个月月均收益,划分偏强/偏弱;比较最近月日收益标准差与之前形成期标准差,划分高/低波动。
  3. 两个维度交叉为稳定趋势、过热、缓慢恶化、压力四状态。各策略按自己的所选行业计算状态,所以相同名称不保证相同月份。
  4. 全样本两策略月均1.57%和1.66%,基准1.16%;作者再展示状态条件收益,而未给出冻结切换规则后的独立样本外策略。

关键结果

原文结果与口径
核对项结果意味着什么
12–1:稳定 / 压力月2.32% / 0.94%状态条件月均收益,不是连续持有一年的可实现CAGR。
12–0:稳定 / 压力月1.86% / 1.35%状态日期与12–1不同,不能直接解释为同月替换收益。
最大回撤:12–1 / 12–0−60.47% / −53.65%纯多行业策略仍有很深回撤,状态均值为正不意味着规避危机。

怎么理解?

最值得做的下一步,是将两策略放到同一条件下比较。若12–0因为包含最近月而换入另一批行业,它既改变仓位,又改变用于分状态的组合;表中更平稳的条件均值可能部分来自状态样本变化。先用一个事前固定的市场状态或同一行业篮子标记所有月份,才更接近检验“跳月”本身的增量。 还要警惕把稳定状态的条件CAGR当成可投资收益。它相当于只拼接那些月份,实际投资者不能删除其余月份;剩余时间持有现金还是另一策略,会改变完整净值、成本和风险。

最大限制

没有成本与严格的未见样本切换检验;只做多的选择本身有观察短边表现后的判断。行业组合不是个股,不能据此废除A股个股动量的跳月惯例。原文对条件关系用词偏强,但未提供机制因果识别。

复现与研究价值

用当前可得个股样本另起实验:先固定股票池、复权和可交易过滤,再比较相同月份的12–1与12–0,并分开报告排序变化与状态过滤的收益。只使用当时已知数据,避免10年、20年滚动要求;本条未运行回测。

原文与核查

导读及20页作者公开论文全文已读;未执行代码。

原始文章 ↗

作者原论文(Zenodo)

作者代码与数据说明

推荐 84/100 · 问题 28/30 · 证据 21/30 · 方法 22/25 · 复现 13/15

公开论文、代码与清晰参数很适合复核;条件日期不一致和缺成本限制策略结论。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 技术教程

PCA 保留九成方差,不等于保留九成 Alpha:无监督学习教程该怎样用

Unsupervised Learning for Trading: K-Means, PCA & Python Examples

Ashutosh Dave / QuantInsti

一句话先讲结论

教程用 12 只股票的 ROE 与 Beta 做聚类,再把 7 只股票的收益输入从 7 维压到 4 维,保留约 90.3% 的样本方差;但没有证明预测准确率或策略收益因此改善。对量化研究员,最重要的区别是:PCA 保留的是输入变化最大的方向,不是未来收益最有用的方向,低方差部分也可能藏着真正的相对价值信号。

它到底在问什么?

没有未来收益标签时,机器能从股票特征中找到哪些结构?这些结构可以帮助压缩数据、寻找候选配对,但怎样避免把“看起来分得很清楚”当成已经找到交易优势?

作者具体怎么做?

  1. 聚类演示取 12 家公司的 ROE 与 Beta,对两个特征标准化后做 K-means;先任意设两组,再观察不同组数下的簇内离差拐点,认为三组值得考虑。
  2. PCA 演示使用 272 行、7 列股票收益,先拟合全部主成分,再按累计方差选择前四个。其解释方差比例约 50.7%、21.4%、12.2%、6.0%,合计约 90.3%。
  3. 把原收益矩阵投影为 272×4 的新特征,留给后续监督学习。文章没有继续报告完整预测模型、外样本检验、组合回测或净交易成本。
  4. 标准化与中心化需区分:PCA 默认中心化不等于每列除以标准差。实际输入尺度决定哪个方向更容易成为第一主成分,不能忽略预处理选择。

关键结果

原文结果与口径
核对项结果意味着什么
PCA 特征维度7 → 4减少三个输入方向,但是否提高后续预测尚未测量。
前四成分解释方差约 90.3%样本内输入方差,不是模型准确率、收益解释力或保留 Alpha 比例。
交易效果未报告教程结束在特征构造阶段,不能补成已成功配对交易。

怎么理解?

用于量化研究时,我更看重标签稳定性和时间稳定性。K-means 的“第 0 类”不带固定经济含义,重训后编号可以交换;如果直接把编号作为择时信号,会制造并不存在的状态变化。应匹配簇中心,再看证券分组是否真正改变。 PCA 也有类似问题:主成分符号可翻转,接近的特征值对应方向会旋转;全样本拟合再切训练测试,还会把未来协方差结构提前告诉过去。正确流程是在每个训练窗口拟合标准化和分解,只把已冻结变换应用到随后数据,同时保留不用 PCA 的基线,检查降维究竟减少噪声还是丢失预测信息。

最大限制

例子规模小、选择的股票并非随机全市场,仍含历史旧代码与行业称呼不严谨之处;不能当作当前证券分类。网页没有可靠明确的首次发表日期,本年度收录不等于今年原创。未执行示例代码或验证其当前依赖兼容性。

复现与研究价值

对现有信号库比较原特征、标准化 PCA、风险分组聚类三条冻结管道;相同训练窗口、模型预算和交易成本下,分别报告预测、换手和风险暴露。配对交易候选还需要独立价差稳定性与执行验证,不能只用“在同一簇”作为下单条件。

原文与核查

公开教程及结果数组完整阅读;未运行代码,无策略收益可核验。

原始文章 ↗

推荐 68/100 · 问题 22/30 · 证据 14/30 · 方法 20/25 · 复现 12/15

适合工程入门和预处理审查;无交易实证,不能按 Alpha 研究评价。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 研究综述

预测市场研究综述把三种问题放在一起:概率校准、交易收益与信息优势不是一回事

Research Review | 24 April 2026 | Prediction Markets

James Picerno / The Capital Spectator

一句话先讲结论

这篇综述列了7篇预测市场研究,但最重要的不是“预测市场有效还是无效”:Polymarket价格与期权风险中性分布的差异,不能直接叫错价;赢家集中、做市收益、EPS反向交易和疑似信息交易也分别对应不同对象。把概率校准、交易PnL和信息优势混成一个“市场智慧”指标,会得到错误结论。

它到底在问什么?

预测市场既可以被当作事件概率、交易场所,也可以被当作信息聚合器;这些评价标准能否互相替代?

作者具体怎么做?

  1. 第一类比较Polymarket的BTC/ETH概率与期权隐含风险中性分布,关注尾部、波动和摩擦;不能直接将差异转成交易Alpha。
  2. 第二类研究钱包、订单流和期限,讨论favorite-longshot/Yes bias及大户是否真正更有信息;需要控制到期时间和极端价格路径。
  3. 第三类研究Kalshi宏观预测、338个EPS市场的反向交易以及150百万笔交易中的做市/吃单角色,将概率预测与事件后收益分开。
  4. 最后一篇用210,000个钱包—市场组合筛出异常盈利;异常分数是审查线索,不是法律上已证明的内幕交易。

关键结果

原文结果与口径
核对项结果意味着什么
Akey等最新版本588百万笔 / $67bn;前1%拿76.5%利润最新摘要口径,旧版本数字不应同时使用。
EPS事件市场338个已结算市场综述转述的短期反向交易样本,不是全部预测市场。
异常钱包筛选210,000对;胜率69.9%复合筛选统计,不能单独证明违法或非公开信息。

怎么理解?

读这类综述时,先把问题分成三张表:概率是否校准、谁在交易中赚钱、价格是否含有可识别的新信息。三张表的分母、成本和时间尺度都不同。对量化研究最有用的是研究设计:用风险中性分布做外部基准,用事件结算做真实标签,再用钱包行为解释谁承担了错误定价。 综述本身也暴露了版本管理风险:同一Akey论文在不同月份的样本和利润集中度不同。引用前必须锁定版本日期,不能为了让数字更漂亮而拼接旧摘要。

最大限制

未逐篇取得7篇论文全文;原文链接有SSRN访问限制。综述的“显著”“异常”“技能”均不能替代作者完整的标准误、交易成本和样本选择检查。涉及疑似内幕交易时仅作研究描述,不作法律判断。

复现与研究价值

建立预测市场研究台账,分列Brier/校准、结算后PnL、做市角色、流动性和信息时点;每条结论记录论文版本与原始样本。先复现一类可公开取得的BTC合约,再决定是否扩展到钱包层。未执行。

原文与核查

公开综述全文已读;7篇底层论文未全部取得全文。

原始文章 ↗

推荐 69/100(暂定) · 问题 26/30 · 证据 17/30 · 方法 19/25 · 复现 7/15

综述能搭出研究地图且提醒版本差异;底层论文未逐篇审计,不能直接据此交易。

返回全年目录 ↑

Quantocracy / Word 标准 · 材料受限,不计完整解析 / 论文导读

先让整套研究流程在无信号数据上失败,再相信它在真实市场的成功

Backtests Lie: Building a Stress-Test Framework for ML Trading Signals

Vertox;底层论文 Sotirios D. Nikolopoulos

一句话先讲结论

在底层公开论文的无信号模拟中,只试一个模型,样本内“显著”的概率约 5.3%;试 100 个再挑最好,升到 99.9%,但赢家到独立前推样本的统计量仍接近无信号水平。最值得借鉴的不是再加一个回测评分,而是把清洗、调参、选模型、择时阈值整条管道放进已知没有 Alpha 的环境,看看它是否仍能制造漂亮结果。

它到底在问什么?

回测很好看,究竟是发现市场规律,还是研究管道擅长从噪声中挑赢家?只对最终策略做显著性检验,会遗漏前面失败的试验和隐含调参。

作者具体怎么做?

  1. 第一阶段测试整条研究流程,而不只测试最终模型。构造严格无条件方向优势的参考过程,以及专门带有微观结构假象的安慰剂过程,观察前推检验是否异常拒绝零收益。
  2. 第二阶段才在真实历史上冻结样本内选择,并在不参与选择的未来块上评估。论文用样本内与前推绝对统计量的差来描述膨胀,比例型 BIF 只是补充诊断,不是校正后 p 值。
  3. 作者比较搜索数量和候选相关性,并做已知存在弱信号的正控制。没有发现信号既可能说明确实不存在,也可能是事件太少、检验没有足够统计功效。
  4. 实际案例检查 SPY 方向预测、FF25 横截面模型和波动预测;结果并非一律判错。FF3 调整后仍显著的横截面结果就没有被认定为纯 Beta,说明审计应服从证据而不是预设结论。

关键结果

原文结果与口径
核对项结果意味着什么
无信号下挑选样本内赢家5.3% → 99.9%1 与 100 个候选的模拟比较,不是市场上所有研究的错误率。
SPY 案例毛 Alpha0.39%/年;p=0.931这一个方向预测管道没有显著样本外优势,不能推导所有深度模型无效。
博客新增加密资产结果未报告付费正文受限,不能从底层论文推断作者改进后赚了多少。

怎么理解?

我最赞同“检验生产结果的机器,而非只检验结果”。如果缺失值处理、全样本标准化或信号阈值已经用到了未来,即使最后一层写着 walk-forward,仍然不是时点正确的评估。把这些步骤整体封装后送入负控制,往往比盯着策略曲线更容易定位错误来源。 但这套框架不是防过拟合认证。参考环境只能覆盖你想到的错误;如果反复根据同一批安慰剂调管道,它也会成为训练集。论文中的 99.9% 是特定模拟值,在独立且单次误拒率恰为 5% 的理想化情形,100 次至少一次误拒约为 99.4%;因此重点是搜索放大假象,不是把一个百分比当普遍常数。

最大限制

已读原论文相关方法与主要结果,但没有独立验证代码和全部数学论证。有限样本、序列相关与稀疏交易影响检验校准;样本内/外统计量的比值不能替代收益归因和正式多重检验。收录博客的付费新增内容仍未取得,因此保持部分材料状态。

复现与研究价值

给量化研究流水线增加三套冻结测试:纯方向无信号、保留波动聚集的无信号、可报价但不可无成本捕获的价差跳动;再加入一套明确微弱信号的正控制,防止过严审计把所有策略都拒绝。所有选择步骤只在训练段执行,研究全集和失败尝试一起留存。

原文与核查

付费博客只读公开预览;已追读底层 arXiv 论文方法与主要实验,本篇按底层研究解析。

原始文章 ↗

底层原论文:Spurious Predictability in Financial Machine Learning

原论文公开 HTML v1

推荐 87/100(暂定) · 问题 30/30 · 证据 23/30 · 方法 24/25 · 复现 10/15

管道级证伪设计对研究纪律很有价值;博客新增实验受限,底层模拟仍需代码审计。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 产品介绍

TradeLock 锁定的是事前信号记录,不是证明实盘成交和可实现收益

TradeLock: New site from ex-Quantocracy contributor Sanzprophet - build independently verified track record

TradeLock

一句话先讲结论

TradeLock 的价值是给提交的交易或信号加时间戳,减少事后改写历史的空间;它自己也明确说,不证明真实成交、滑点、冲击、账户归属或实际投入资金。因此它可以把回测向前推进成可检查的纸面记录,但不能把这条记录升级成经审计的实盘业绩。

它到底在问什么?

研究员如何证明今天展示的交易想法真的是当时提出的,而不是看到行情以后补写?这是“时间先后是否可信”的问题,与“订单是否能成交”是两道不同的审核。

作者具体怎么做?

  1. 官网介绍可通过手工、webhook、API 或 MCP 提交交易和组合更新,平台按到达时点记录。本文只说明公开产品机制,没有替用户提交任何信号。
  2. 记录默认私有,用户可选择公开 factsheet 或直接分享;官网声称提交后不能静悄悄改写过去,但本站未进行管理员权限与存储机制的安全审计。
  3. 官网定位偏流动性较好、较低频策略,并明确排除对实盘成交、滑点、市场冲击和资本投入的认证。其公开示例仍是产品展示,不应当成独立验证样本。

关键结果

原文结果与口径
核对项结果意味着什么
能够提供的证据提交时间与历史留痕有助检查信号是否事前存在,具体防篡改能力未被本站审计。
不能证明成交与容量官网主动承认的边界,而非本文已经发现其成交错误。
独立收益实验不存在这是产品介绍,不应填入年化收益、夏普或论文样本量。

怎么理解?

量化研究最容易遗漏的是另一种选择偏差:即使每条已发布记录都无法改写,研究者仍可同时创建很多策略,只挑后来表现好的公开。单策略防篡改不等于研究全集透明。团队治理还需要在实验开始时登记策略全集、版本号与停运记录,而不是只锁住最终赢家。 这类工具最合适的位置是证据链中间:代码版本和输入快照说明怎么算,外部时间戳说明何时算,券商订单和资金记录说明实际做了什么。把三层放在一起,才能区分预测能力、执行质量和事后筛选。不能只看到一个 verification 标记就跳过后两层。

最大限制

本次仅阅读公开产品页,没有注册、调用写入接口或审计服务可用性与安全性。价格、隐私与保存政策可能变化,部署前应重新核查正式条款。首页无明确文章发表日,因此来源日期保留未知,仍按原目录收录月份呈现。

复现与研究价值

自有研究平台可先做最小留痕设计:信号生成时间、数据版本、代码提交号、预期下单时间和每次修订原因全部追加保存;同时登记失败和停止的策略。如果选用第三方,再检查完整导出、时间精度和更正记录,不把用户数据默认公开。

原文与核查

公开产品页已解析;不是论文,也未验证实盘收益。

原始文章 ↗

推荐 63/100 · 问题 24/30 · 证据 10/30 · 方法 20/25 · 复现 9/15

事前留痕对研究治理有用,但这里只核对产品陈述,未做功能或安全审计。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 论文导读

日内买波动、隔夜卖波动?先看互换损益口径,再谈能否交易

Volatility Risk Premium and Clustering: Intraday vs Overnight Dynamics

Harbourfront / Relative Value Arbitrage

一句话先讲结论

把方差互换损益拆成隔夜与日内后,原论文在 14 个标的中发现 10 个日内平均损益为正,隔夜则全部为负;但日内正值并非都显著,更不是直接买 VIX 就能赚。文中量度是做多假想方差互换的逐日盯市损益,既含实现方差,也含剩余期限隐含方差重估,不能简化成一条“白天买期权、晚上卖期权”的已验证净收益策略。

它到底在问什么?

同样承担波动风险,交易时段与休市时段是否获得相同补偿?把两者合并成一个日度波动率,会不会丢掉风险价格和波动持续性的差别?

作者具体怎么做?

  1. 第一项研究使用欧美亚股指及个股对应的 30 日期限隐含波动指数,计算假想方差互换从前收盘到开盘、再到收盘的损益,比较时段差异。
  2. 本站追到正式期刊,核对共同样本为 2012-01-30 至 2022-09-30;方法需要对剩余期限方差价格近似,并按日历时间处理周末,而不是所有间隔都算一天。
  3. 导读还比较这些时段指标对后续股票收益的预测期限:日内偏较短期,隔夜偏较长期。这里是回归预测关系,不是已经完成期权执行测试。
  4. 第二项研究考察 15 个股票市场,导读报告两类收益都有波动聚集,隔夜通常更强、时段间交叉聚集相对弱。本次未取得该篇完整正文,不据摘要进一步推导模型参数。

关键结果

原文结果与口径
核对项结果意味着什么
隔夜互换损益方向14 个标的均为负买方损益符号;若把溢价定义为隐含减实现,符号会相反,必须先说明定义。
日内平均为正10 / 14正值不等于全部统计显著;不同市场的周内效应也不完全一样。
可交易净收益尚未验证表格为假想互换口径,不能直接替代期权组合、保证金与成交成本。

怎么理解?

我会把这篇用来改风险分账,而不是直接发交易指令。若风险主要在无法连续对冲的时段发生,全天一个限额会掩盖隔夜跳空与日内可调整仓位的本质差别。对同一证券分别保存隔夜、日内收益和隐含波动变化,能帮助判断策略到底在卖哪种保险。 尤其要避免三个偷换:方差不是波动率,VIX 点位不是可直接买入的资产,互换盯市利润也不是资本回报率。一个显著的均值如果要靠每天跨买卖价差反转头寸才能获得,净收益可能消失;隔夜卖方承担的尾部跳跃则可能恰恰是这份补偿存在的原因。

最大限制

没有执行互换复制或期权回测,未核对第二篇全文;第一篇的期限结构近似和开盘价格可实现性需要进一步审计。公开导读对“多数日内买波动盈利、周五除外”的概括不能推广到所有市场,正式表格存在市场间差异。

复现与研究价值

在自有波动研究里先统一买方/卖方符号,并把日内和隔夜风险分开预测;再用真实期权链、同步报价与交易时点复制可行组合,计入对冲、点差、跳跃及保证金。用同等尾部风险而不只同等波动比较收益。

原文与核查

公开导读完整解析;第一篇正式论文方法和关键表格核对,第二篇全文未取得。

原始文章 ↗

方差风险溢价原论文(正式发表版)

波动聚集原论文

推荐 83/100 · 问题 28/30 · 证据 23/30 · 方法 23/25 · 复现 9/15

时间分解与符号澄清很有价值;两篇证据层级不同,交易实现尚未验证。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 方法研究

美股占全球组合71%,能反推出投资者预期美股多赚多少吗?

Mean-Variance Optimization in Practice: Reverse Optimization and Implied Expected Returns

Portfolio Optimizer

一句话先讲结论

把全球股票组合中71.27%的美股权重代入均值—方差逆向优化,文章得到美股隐含收益7.48%、非美5.82%,相差约1.7个百分点;但换一个收益锚点,两者就变成9.09%和7.07%。这些不是市场对未来的客观预测,而是给定协方差、风险厌恶和最优性假设后,让当前权重合理化的一组答案。

它到底在问什么?

正向优化输入预期收益、输出权重;反过来,能否从一个已经持有的组合,知道它隐含了什么收益判断?

作者具体怎么做?

  1. 先选择被假定为有效组合的参考权重,可以是市值组合,也可以是风险平价等自选组合。选择后者不等于证明市场遵循风险平价。
  2. 估计资产收益协方差Σ,再指定λ;文章讨论用组合风险溢价除以方差、夏普除以波动率或某资产收益锚点来确定尺度。
  3. 若要求权重加总为1,解变为 μ=λΣw+γ1;一般线性约束还会引入对应乘子,非负约束在零权重资产上可能只给出不等式边界。
  4. 实证示例采用截至2026年3月的美股/非美权重,配合1979年以来月收益估计的年化协方差。λ约3.015时得7.48%与5.82%;锚定美股9.09%时则得9.09%与7.07%。

关键结果

原文结果与口径
核对项结果意味着什么
参考美股权重71.27%输入的市场权重,不是优化后建议仓位。
第一组隐含收益7.48% vs 5.82%依赖作者的历史Σ与λ,差约1.66个百分点。
改用美股收益锚点9.09% vs 7.07%同样权重可以对应不同收益尺度,不能唯一读出投资者信念。

怎么理解?

最有价值的用途不是预测,而是检查组合与观点是否相容:如果团队声称不看好美股,却在自己认可的风险模型下持有很高的美股权重,就需要解释风险预算、约束或判断是否不一致。反推结果是一次诊断,不是让持仓自动获得理论背书。 这里还有一个应当修正的小公式错误:按 μ=λΣw,若用第i个资产的目标收益定λ,应为 μ目标/(Σw)i,网页相应一处写成了倒数。另一个常见误解是预算约束的共同常数γ能随意改变两资产收益差;λ和Σ不变时,共同加数在作差后会消失。

最大限制

把市值权重视为均值—方差有效,隐含了强最优性假设;长期协方差可能不代表当前环境,市场价格也包含约束、负债匹配和非均值—方差偏好。文中没有给出据此预测下一期收益或交易获利的样本外证据。

复现与研究价值

对实际股票组合固定同一权重,分别用短期、长期及收缩协方差反推,并报告不同λ锚点下的区间。若结论主要来自协方差选择,就将它列为模型风险,而不是投资信念;这是研究提案,未运行。

原文与核查

公开全文、推导及案例已读;未独立下载历史收益或执行优化。

原始文章 ↗

推荐 84/100 · 问题 27/30 · 证据 22/30 · 方法 23/25 · 复现 12/15

推导与数值可核对,适合组合诊断;不能当预测模型,网页公式有一处倒置。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 论文导读

同一个动量策略,只改调仓日,年化就能差 3.48 个百分点

The Tranching Dilemma

Quantpedia;原论文 Carlo Zarattini / Alberto Pagani

一句话先讲结论

在 1991—2024 年同一套美国个股动量规则下,只把每月调仓日挪动,最佳与最差配置的 CAGR 就差 3.48 个百分点,1 美元期末分别变成约 272 和 99 美元。分成 5 批错峰调仓后,时点差异降至 0.63 个百分点,但平均毛 CAGR 只从 16.73% 变为 16.84%;它主要分散调仓运气,不是创造新 Alpha,小账户还可能被更多笔最低佣金反噬。

它到底在问什么?

两个基金选股方法相同,业绩为什么仍可能明显分叉?月底附近涨跌、信号排名变动和持有期不同,会不会让看起来属于研究能力的优势,其实只是执行日期幸运?

作者具体怎么做?

  1. 作者原文从历史 Russell 3000 选最活跃的 1,000 家,按跳过最近一月的年度动量选 100 家,再按日收益涨跌分布筛出动量较连续的 20 家,等权持有;信号在 t 日收盘计算,t+1 日收盘执行。
  2. 先测试月内 20 种调仓日,再测试 1、2、4、5、10、20 批均匀错开的日程。RTL 在这里定义为同一批数下最佳与最差日程的 CAGR 极差,不是收益标准差。
  3. 成本前比较平均收益、日程间差异、交易笔数与换手;随后加入每股佣金、最低单笔佣金和冲击模型,在固定参考账户规模下归一化成本。
  4. 选择批数的目标是平均净 CAGR 减去 RTL。原文得到 2.5 万美元约 2 批、10 万美元约 5 批,更大账户更受益;这是该成本模型与目标函数的结果,不是通用最优日程。

关键结果

原文结果与口径
核对项结果意味着什么
调仓日期的年化极差3.48 pct → 0.63 pct1 批与 5 批比较;不是把波动率降低到原来的某一固定比例。
平均毛 CAGR16.73% → 16.84%几乎不变,说明主要减少日程差异,不能包装为收益提升策略。
原文最优批数$25K:2;$100K:5依赖账户规模、成本参数及 CAGR−RTL 目标;不是直接给用户的交易参数建议。

怎么理解?

最容易误读的是“多做几批会增加换手”。本文增加的是交易笔数,每笔更小,累计交易金额与本金之比却几乎没变。因此纯比例收费未必增加很多,最低单笔收费会变差,非线性的市场冲击反而可能改善。讨论分批成本必须先分清这三种费用。 我还会把“20 批时 RTL 为零”读得更谨慎:在作者定义的均匀日程里,20 批只剩唯一安排,当然没有其他日程可以比较;这不意味着组合没有执行误差、没有市场风险,也不意味着未来收益确定。目标函数把一个百分点的日程极差与一个百分点的平均收益等权相减,同样是决策偏好,不是金融定律。

最大限制

这是集中动量案例,不能外推全部因子;正文关于个别 Alpha 临界显著的措辞还需与表内 p 值一起看,不能据此说整体 Alpha 稳健。碎股、历史调整价和参考规模归一化都是模型假设。未加入仓位容忍带与合并子组合净订单等常见实盘优化,也未独立执行回测。

复现与研究价值

对现有个股策略做一个低成本补充:冻结选股规则,遍历可行调仓日,先报告平均、最好、最差,而不挑最优日上线;然后在组合净订单层比较 1、2、4 批与仓位容忍带。使用本账户实际最低费用、成交量和约束,明确愿意付出多少收益来降低日程不确定性。

原文与核查

导读与作者官网论文方法、主要表格和成本框架已读;未独立复现。

原始文章 ↗

作者官网原论文 PDF

SSRN 原始登记

推荐 90/100 · 问题 29/30 · 证据 25/30 · 方法 24/25 · 复现 12/15

直接揭示易被忽视的实现风险,成本与目标函数可核验;不构成策略 Alpha 背书。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

把 TLT 补到 1962 年:可以扩展压力场景,不能把高相关当成无误差历史

Sixty-four years of TLT: reconstructing the bond ETF everyone owns

Beyond Passive Investing

一句话先讲结论

作者用国债收益率重建长债总回报,把只有二十多年实价的 TLT 向前延到 1962 年;月度版本与真实 TLT 回报相关约 99%、跟踪误差约 1.9%,日度误差却约 4.7%。这能帮助检验组合在高通胀年代的脆弱性,但不是找到了 64 年真实 ETF 净值;尤其 1977 年前的收益率来自全重叠期回归外推,不能直接当历史时点可用数据。

它到底在问什么?

仅从 ETF 成立日起回测,会不会错过长债在其他利率状态下的损失?要扩展历史,应模拟一只固定债券持有到期,还是模拟不断换入长久期债券的投资组合?

作者具体怎么做?

  1. 按固定现金流折现计算债券价格。每个持有期用上期收益率设平价票息,本期按新收益率及缩短后的剩余期限重新估值,再加应计票息,形成总回报序列。
  2. 比较月度、日度和期限梯形三种构造,在 2002—2014 年校准期限参数,2015—2026 年验证。尽管基础定价公式不需要统计拟合,具体 TLT 近似仍有校准步骤。
  3. 30 年收益率早期不足时,以 1977—2026 年的 30 年对 20 年收益率回归向前外推,并用 60 日线性过渡处理衔接。作者报告回归样本内 R² 0.997,但它不直接检验更早年代的误差。
  4. 用真实 TLT 重叠期检查收益相关、跟踪误差、误差自相关及长期漂移,再将合成历史的重大损失与其他公开长债记录对照。不同基准期限并不完全相同,不能要求逐年数值完全重合。

关键结果

原文结果与口径
核对项结果意味着什么
月度验证约 99% 相关;1.9% TE作者报告的模型跟踪指标,不是预测收益准确率。
日度验证约 4.7% TE对短持有期和日内阈值可能重要;不能因月度接近就忽略。
日度误差一阶相关−0.41与时点错位相容,但单凭负自相关无法排除所有模型误设。

怎么理解?

这篇对组合研究的价值在于补充利率状态,而不是把历史长度当成数据质量。用更晚年代校准出来的期限和期限间关系重建 1960 年代,是事后模型化的压力场景;它可以回答“这种利率路径大概会怎样”,却不能直接回答“当年可实时执行的择时策略赚了多少”。 我也不会接受“日度误差完全是三十分钟时间差、对周度以上无关紧要”的强判断。现券估值、ETF 收盘、久期漂移、曲线非平行移动和费用都可能贡献误差。最直接的区分实验是使用同步时点比较,观察误差还剩多少。另需注意,低起始收益率使利率上升时更脆弱,是条件风险关系;它不意味着当时已经能确定未来利率必然上行。

最大限制

原文未提供本文可独立执行的完整重建环境。全文一些基础表述过强,例如把低起点后的亏损称为机械必然;价格变化仍取决于之后利率路径。IEF 也不应与 20 年以上 ETF 混为相同期限产品。日度误差、平价债近似和历史外推必须随数据一起交付。

复现与研究价值

给研究数据库同时保存真实 ETF、合成历史和来源标记,任何回测自动按两段出报告。宏观压力测试可用长历史;短期择时优先真实可交易期,并对同步时间戳、平行曲线假设及参数校准期做敏感性分析。不要把平滑拼接引入的未来信息混入信号。

原文与核查

公开正文和验证口径已读;未重建或审计完整债券历史。

原始文章 ↗

原方法:Treasury Bond Return Data Starting in 1962

推荐 82/100 · 问题 28/30 · 证据 21/30 · 方法 23/25 · 复现 10/15

历史构造与误差讨论有研究价值;模型化数据不等于真实时点记录,因果解释需收敛。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

预测市场低位买入:有的年化22%,有的只加10bp成本就由赚转亏

Exploiting Mean-Reversion in Decentralized Prediction Markets: Evidence from Polymarket

Cyril Dujava / Quantpedia

一句话先讲结论

在三个最终都结算为NO的预测合约上,作者测试滚动低位买入。最平稳的“耶稣回归”合约,5日低点买入、持有1日,零成本年化7.95%,每边加入10bp后变成−7.83%;而外星人合约某组参数扣费后年化22.09%。这说明价差和换手足以决定结果,并不能证明三个事后选出的事件构成稳定套利。

它到底在问什么?

当极端事件被情绪反复推高概率时,反向合约的短暂下跌能否提供可以成交、覆盖成本的均值回归机会?

作者具体怎么做?

  1. 用约一年10分钟价格,三个合约分别约4.1万、4.9万、5.3万个观测;这是报价频率,不是同等数量的独立事件。
  2. 以5、10、20日滚动最低价为入场阈值,持有1、2、3、5日,共12组参数;不叠加持仓,使用全额可用资金。
  3. 比较零成本和每次买卖各10bp两档,分别报告年化收益、夏普和最大回撤。零成本限价成交是一种情景,不是被订单记录证实的事实。
  4. 作者对部分2025年11月异常价格作前值填充;这种清理应回查真实成交,不能仅因尖峰不美观就删除可能恰是策略损失的行情。

关键结果

原文结果与口径
核对项结果意味着什么
耶稣合约:成本冲击7.95% → −7.83%5日回看/1日持有,从零成本改为每边10bp的CAGR变化。
中国合约:20日/5日18.91% vs 12.57%扣费策略与持有的年化收益;单一事件期间结果。
外星人合约:10日/5日22.09% vs 8.52%扣费策略与持有CAGR,不是跨事件样本外收益。

怎么理解?

这篇真正值得读的是执行敏感性,而不是挑最高夏普。NO价格接近结算面值时,涨幅空间天然变小,小幅回撤反弹收益很容易被双边摩擦吃掉。不同事件的消息冲击和盘口厚度又不同,同一成本常数并不能代表真实成交。 作者以四小时最高最低价差辅助估计摩擦,但区间振幅不是买卖报价差:前者含真实价格变化,后者还要考虑时点、排队和逆向选择。用被动单也可能只成交后续继续下跌的订单。要验证这条策略,首要问题是哪些低价真的买得到,而非再扫更多回看天数。

最大限制

样本仅三个最终NO事件,存在事件选择和幸存条件偏差;约一年数据不足以估计罕见大损失。12组参数内选优、异常值人工处理和不清楚的入场窗口端点都应复核。这里也不把预测市场称为无风险资产。

复现与研究价值

事前冻结全部符合条件的事件池,同时纳入最终YES和NO;保存订单簿、撤单及部分成交,按事件留出而非随机抽10分钟行。先比较合理成交下的毛收益与总费用,再决定是否值得做参数研究。未执行该复现。

原文与核查

公开文章方法与结果表已读;未取得订单级成交数据。

原始文章 ↗

推荐 73/100 · 问题 27/30 · 证据 17/30 · 方法 20/25 · 复现 9/15

成本反转很有启发,但三事件选择、成交假设与调参使可交易证据较弱。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

一套通胀信息做六类交易:组合夏普1.3,但不是六个独立Alpha

Inflation as a trading signal

Elena Sueppel / Ralph Sueppel

一句话先讲结论

Macrosynergy把当时可见的通胀超标程度和近期通胀意外,分别用于国债、利率互换、股指与外汇六类交易,合成组合报告夏普1.3、Sortino 2.0。但这是一组未扣交易成本、不计复利的信号损益实验,而且不少单策略盈利集中于2010—2024年;它更能说明通胀信息可跨市场使用,不能直接视为随时稳定获利的六个独立策略。

它到底在问什么?

同一条CPI信息,除了预测利率,还能否通过不同市场的政策反应和风险补偿产生可分散的交易信号?

作者具体怎么做?

  1. 分别计算总体和核心CPI的同比、6个月及3个月年化动态,减去兼顾官方目标与历史兑现情况的有效目标;再以目标与2%中的较大者缩放,顺序标准化并截断到±3倍标准差。
  2. 意外项采用发布日前信息建立ARMA(1,1)预测,不是经济学家调查预期;首发与修订都在公开时进入。标准化使用36个月半衰期,随后以21个工作日半衰期累计近期意外。
  3. 超额通胀与意外趋势合成压力指标;高压力对应偏空久期/股票,国家间相对通胀差用于外汇,具体方向由不同定价渠道决定。
  4. 月末信号用于后续持仓并留一天执行延迟,六类账簿采用风险缩放后合成;没有进一步择优权重,但纳入哪些账簿仍带有研究者选择。

关键结果

原文结果与口径
核对项结果意味着什么
六策略合成Sharpe 1.3作者未扣成本的naïve PnL,不是可购买产品业绩。
国债超额核心通胀Sharpe 0.92000年至2026年3月,盈利时间分布并不均匀。
股票信号强度仅G2达到所述显著性不能把每个国家本地通胀都称为显著的股指预测器。

怎么理解?

最值得拿走的是数据定义,而不是1.3这个数字。有效目标、首发意外和修订意外把“市场当时知道什么”变成了可计算变量,减少了用终值数据解释过去的错误。研究员应先重建信息时点,再考虑复杂模型。 分散渠道仍不等于分散信息源。六本账都受到同一通胀周期影响,危机中可能同时放大久期或汇率敞口;低全样本相关不能替代压力期风险检查。作者认为未展示失败策略造成的事后偏差较小,但没有完整研究日志就无法量化这个判断。

最大限制

宏观数据及部分可交易收益序列需DataQuery/JPMaQS权限。无交易成本、冲击与完整融资预算,波动率目标也不保证危机期实际风险。ARMA意外与市场预期意外并非同义,跨国制度差异可能改变方向。

复现与研究价值

先在有真实发布时间的少量市场实现超额通胀与意外两条独立信号,再比较水平、意外和合成版本。记录每类账簿成本、总久期、美元敞口与压力期共振,避免一开始扩到几十国却无法核对数据。未执行。

原文与核查

公开完整研究文章已读;未调用付费数据或运行notebook。

原始文章 ↗

推荐 86/100 · 问题 29/30 · 证据 24/30 · 方法 24/25 · 复现 9/15

时点数据与跨市场机制清楚,信号工程价值高;商业数据和无成本实验降低直接复现便利性。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 方法说明

AutoTune 自适应周期:滚动测试仍报约 25% CAGR,但还没证明周期识别真的有用

The AutoTune filter

Petra Volkova / The Financial Hacker

一句话先讲结论

作者把 Ehlers 的自适应周期滤波器移植到 Zorro,在 ES 日线、2010—2025 年、10 个 walk-forward 周期下,报告 CAGR 约 25%,低于原先样本内优化的漂亮曲线。但它没有把“识别出的周期”与固定周期、随机周期做同规则比较,所以目前只能说整套交易系统表现不错,不能单独证明自动识别主导周期贡献了收益。

它到底在问什么?

行情的有效周期会变,固定长度的滤波器容易错过节奏。那么,动态估计周期再调整滤波器,是否真的比固定参数更好?需要区别数学上能分解频率与交易上能预测下一段周期。

作者具体怎么做?

  1. 对价格先做高通滤波,再计算不同滞后的相关性;取相关性最低的滞后并乘二作为周期估计。代码把本次周期变化限制在上次估计的 ±2 根 K 线内,以避免跳变。
  2. 把估计周期送入带通滤波器,以滤波结果相隔两根 K 线的差值作为 ROC;向上穿零做多,向下穿零做空,并用最小相关阈值筛掉不明显的周期状态。
  3. 公开代码的多空规则并不对称:做空还要求高通滤波值大于零。优化窗口 10—30、带宽 0.10—0.30 和相关阈值,对 ES 日线实施 10 个 walk-forward 周期,并加入资金管理。

关键结果

原文结果与口径
核对项结果意味着什么
作者报告 CAGR约 25%整套 ES 期货系统的结果,不是无杠杆指标收益;成本细节未充分列示。
滚动训练测试10 个周期优于单次样本内优化,但作者对模型结构的历史选择仍可能影响结果。
自适应模块独立增量未报告缺少相同交易规则下固定周期/随机周期消融对照。

怎么理解?

这篇的代码透明度比单纯展示净值高,读者能看出收益并不只来自周期估计:它还包含状态过滤、方向不对称与头寸管理。若这些模块贡献主要利润,滤波器自动调频可能并不是核心优势。 我的首要检验不是扩大参数网格,而是保持其他代码完全相同,只替换周期输入。如果固定周期也差不多,复杂估计没有必要;如果随机周期也一样好,就更需要怀疑“发现了市场节奏”的解释。还应把收益序列中的可预测性与波动序列的周期性分开,日内活动规律未必能预测价格方向。

最大限制

本站只读代码,未在 Zorro 执行;不能确认所有参数选择、费用、合约换月与资金管理实现。CAGR 受期货杠杆影响,原文没有提供同风险买入持有对照。页面评论者的反驳是另一套实验,本解析不把它当对当前 ES 策略的直接证伪。

复现与研究价值

优先四组同代码消融:固定周期、实时估计、滞后一个窗口的估计、保留周期分布但打乱顺序。统一仓位和成本,比较样本外 Sharpe、换手及每组训练期贡献,再决定是否把滤波器加入个股或指数信号。

原文与核查

已读正文与公开代码;未运行回测,未读取 TASC 付费原文的完整研究。

原始文章 ↗

推荐 81/100 · 问题 26/30 · 证据 20/30 · 方法 23/25 · 复现 12/15

公开代码且采用滚动测试,便于定位机制;缺少自适应模块消融、同风险和完整成本对照。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 方法教程

SHAP能解释模型为什么买入,却不能证明这个买入有Alpha

Looking Inside The Black Box

Vertox

一句话先讲结论

文章用2010—2026年的SPY数据训练XGBoost,再用SHAP、ICE、ALE和特征删除解释预测;但作者明确没有切训练集和测试集。那些漂亮的“低波动时均值回归、高波动时动量”曲线,只描述这个拟合模型学到了什么,不能据此确认市场规律或构建盈利策略。

它到底在问什么?

预测模型表现异常时,研究员怎样区分真正有用的特征、数据泄漏和模型在错误区域里的想象?

作者具体怎么做?

  1. 示例目标是下一日SPY收益,输入包含5/20/60日动量、波动率、RSI、成交量及缺口,XGBoost用300棵深度4的树,整段数据同时拟合和演示。
  2. CP逐一改变某特征;ICE画多条个体曲线,PDP取平均。对相关特征,这种单独改值可能离开真实数据支持区域。
  3. LIME用邻域简单模型逼近复杂模型;SHAP把相对背景预测的差分配到特征。背景样本、相关特征处理和邻域选择都会影响解释。
  4. ALE在局部区间累积预测变化,置换重要性破坏某列信息,LOFO删列后重新训练。后两者回答依赖程度和可替代性,不是同一个问题。

关键结果

原文结果与口径
核对项结果意味着什么
样本外预测检验未进行作者主动声明示例省略训练/测试切分。
解释对象模型预测,而非实现收益特征推动预测上升,不意味着推动市场价格上升。
相关特征处理需要另外审查多个解释工具仍依赖如何构造缺失/扰动特征。

怎么理解?

用于量化最有价值的做法,是把解释当作反证工具:模型若依赖无法在下单时获得的特征,应立即停下来核对时点;若特征贡献突然跨期翻转,应检查行情分布和模型版本。解释不能替代预测有效性,但能帮助定位有效性为什么消失。 教程代码也不宜直接当生产实现。LIME的原始系数单位不同,不能仅凭大小比较重要性;H统计的中心化与联合PDP构造需要测试,尤其全局实现没有完整处理基准均值。置换段落关于相关特征获得“高重要性”的一句与其论述方向不一致:可替代特征常会互相遮蔽,导致单列重要性偏低。

最大限制

这是教学用的样本内模型,没有策略收益、成本或稳定性证据。SHAP的分摊公平性基于所定义的博弈,不等于经济因果识别;ALE也不能自动消除所有相关与稀疏区域问题。

复现与研究价值

在已有滚动样本外预测上,按行情状态抽取解释样本;共同报告实际IC/净收益、分组置换重要性和解释稳定度,并给每张图标明解释数据、模型训练截止日与背景集。先写已知加法模型的单元测试,验证解释代码再用于黑箱。未执行。

原文与核查

完整教程和示例代码已读,未安装依赖或运行示例。

原始文章 ↗

推荐 81/100 · 问题 28/30 · 证据 19/30 · 方法 22/25 · 复现 12/15

工具地图与代码适合研究排错,但示例不是策略证据且实现细节需修正。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

FinBERT 先过滤新闻:省下调用费,也可能提前删掉最有用的信号

We Trusted FinBERT to Filter the Noise. It Was Also Filtering the Signal

Tommi Johnsen / Svetlana Shasharina

一句话先讲结论

先用 FinBERT 过滤新闻、再交给 Claude,4 月文章曾报告混合流程改善收益;但作者 7 月审计发现次日收益缺失、周末补零和分位排序错误,已经撤回收益改善与收益反转两项结论。修正后混合、Claude、FinBERT 的次日正负组收益差约为 +0.26%、+0.20%、+0.05%,彼此差异和各自收益均不显著。留下的可信发现是:前置过滤确实漏掉了信息,而不是已经证明哪种模型能赚钱。

它到底在问什么?

金融新闻系统应该先用便宜模型筛一遍,再把少数难题交给贵模型吗?如果第一关的错误不是随机噪声,而是把重要事件误判为中性,后面的模型再强也无法补救。

作者具体怎么做?

  1. 作者收集 536 个股票代码、9 个 GICS 行业的 64,608 篇新闻;输入主要是 Google News RSS 的标题和摘要,不是完整报道。检索使用公司名称、代码及同义词,随后判断新闻对目标公司的方向。
  2. 混合流程先让 FinBERT 分类,把中性项直接丢弃,只把其余约 37% 送给 Claude Sonnet;Claude 进一步区分新催化事件与泛泛推荐、旧闻和情绪措辞。在升级处理的新闻里,Claude 又改写了约 65% 的初步标签。
  3. 作者用 991 条 NVDA、AMD 标题比较分类一致率,再把不同模型的标签与当日、次日、后两日收益关联。跨行业汇总的次日正负组收益差约 0.28 个百分点,后两日关系接近消失;当日关系不能直接当作可交易预测。
  4. 最后按短时间窗口拆分,观察模型排名是否稳定,并回头审查 FinBERT 的中性池。该池包含大量财报、指引和带有保留措辞的新闻,说明“中性语气”与“没有增量信息”并不是同一件事。

关键结果

原文结果与口径
核对项结果意味着什么
更正后的次日组间收益差+0.26% / +0.20% / +0.05%依次混合、Claude、FinBERT;全部与零及彼此统计不可区分,不是可交易 Alpha。
中性池中正/负催化标签数之比1.74 / 1.95更正后的两个窗口仍存在漏检不对称;参考标签仍来自 Claude,不是全部经人工核实的事件真值。
所谓分类准确率83.4% vs 58.5%以 Claude 标签为参照的一致率,不是独立人工标注的准确率。

怎么理解?

这篇最值得带回研究流程的,是对“门卫模型”的审查。常见的工程指标只问送给大模型的多少条最后被确认有用,却不问被挡在门外的新闻里漏掉了多少真实事件。前者看起来很省钱,后者才决定信号上限。不能只用升级样本评价整个级联系统。 不过,本文还不能证明全量 Claude 就能创造稳定 Alpha。用 Claude 自己当参考答案,会天然偏好与 Claude 接近的流程;标题里出现“股价上涨”也可能是在报道已经发生的收益。研究员应把目标公司的真实事件标签、新闻首次时间戳和交易收益分开核验,避免把语言判断的一致性误当成投资有效性。

最大限制

版本更正是本篇最重要的限制:上方流程中的4月统计属于原始实验记录,其收益结论被7月审计撤回。新闻与股价同日变化也可能是报道追随行情;作者更正后的样本仍短,不能由未显著推出所有新闻模型永远无效。没有扣费、风险中性的可交易组合证据。

复现与研究价值

实用复现不是立刻换模型,而是对中性池持续随机抽样,由盲审人工标注“是否包含公司新信息”;同时比较全量大模型、小模型硬过滤、随机抽样升级和不确定性升级。统一新闻截点、重复稿处理、行业敞口和成本,再报告漏检率、每千条成本及净组合收益。以上是未执行的研究方案。

原文与核查

4月公开正文已读,并核对7月审计的数据缺陷、撤回声明与修正统计;未独立重跑。

原始文章 ↗

后续更正:The Mechanism Survives, the Magnitude Doesn’t(7月16日)

推荐 79/100 · 问题 29/30 · 证据 16/30 · 方法 24/25 · 复现 10/15

过滤偏差和后续自我纠错很有研究价值;原始收益结论已撤回,因此证据分下调。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 工具评测

RayforceDB“快几千倍”是特定工作负载经验,不是通用数据库排名

Time Series Database Review: RayforceDB

Anton Vorobets

一句话先讲结论

作者称某些 SQL 工作负载迁移到 RayforceDB 后快了几千倍,另有原先跑不完的计算在 30 秒内结束;但没有公开同口径数据、机器配置和完整基准,不能据此认定它全面胜过 SQL、Pandas 或 Polars。对量化团队更有用的是其按日分区、列式向量存储和低开销 Python 接口,是否贴合自己的行情查询与计算路径。

它到底在问什么?

高频行情分析慢,是数据库执行引擎慢,还是数据布局、跨进程搬运和逐行 Python 调用慢?换一个适合列式计算的工具可能很有效,但先得识别自己真正的瓶颈。

作者具体怎么做?

  1. 文章介绍一个以 C 实现、受 kdb+ 启发的列式数据库,可管理内存表和磁盘数据,并提供 Python 绑定。本站补查其官方仓库,确认项目及 Python 包有公开源码。
  2. 作者描述按日期组织分区,复用证券字符串对应的枚举及 symfiles,以减少日间重复标识和连接操作;时间戳可辅助形成日期字段进行范围查询。
  3. 与关系型工作流相比,文中强调没有传统外键和级联删除,数据一致性责任更多落在应用与数据管道;以文件保存和迁移也不自动解决并发写入或备份一致性。
  4. 作者报告 beta 使用体验及与开发者反馈 bug 的过程,但没有提供该案例的公开测试脚本。现在官方另有基准仓库,可作为自测起点,不等于本站已验证它的所有性能主张。

关键结果

原文结果与口径
核对项结果意味着什么
作者报告的速度提升特定任务数量级改善缺少完整配置与对照脚本,不能视为可重复的普遍倍数。
部分重任务少于 30 秒对照任务被提前停止,未测得完整耗时,因此不存在精确加速比。
独立基准验收尚未执行已有公开代码入口,不等于本团队生产环境验证通过。

怎么理解?

我会把它放在“研究基础设施候选”,而非“发现 Alpha”的位置。真正的比较应是相同数据、相同查询语义、相同线程与缓存状态;若旧实现每条记录来回穿过 Python 和数据库,新实现一次向量化,巨幅改善可能主要来自工作流改变,而非某个引擎独有能力。 金融时序应用的验收还必须越过速度:乱序到达、更正行情、跨日证券映射、时区与夏令时、缺失值和 as-of join 都可能静悄悄改变结果。尤其不能为了去掉外键而失去证券主数据的版本约束。一个很快但把更正后行情当成实时可见的数据系统,会高效制造未来函数。

最大限制

本文评价反映 2026 年 4 月作者当时经历,不把 beta 版本号当成当前最新版。作者声明无经济利益,但仍是积极使用者而非独立测试机构;未公开全部生产负载、容错、恢复与并发基准。本站没有安装、迁移或运行用户数据。

复现与研究价值

选三类真实只读负载做小规模对照:按证券滚动统计、跨表时点连接、跨日全市场聚合。先逐结果核对,再比较冷/热缓存耗时、峰值内存和恢复成本;通过后才评估迁移,不因营销倍数直接替换生产库。

原文与核查

公开评测完整解析;官方源码与基准入口核对,未运行性能测试。

原始文章 ↗

官方 Rayforce 源码

官方 Python 绑定

官方基准测试项目

推荐 69/100 · 问题 24/30 · 证据 13/30 · 方法 20/25 · 复现 12/15

开源入口和数据布局启发实用;经验性速度主张缺乏独立对照。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 实盘复盘

Carver年度期货赚23.7%,为什么风险调整后仍落后CTA基准?

Annual performance update- year 12

Rob Carver

一句话先讲结论

Carver报告本年度期货账户净收益23.7%,但这不是家庭总资产收益:总体只有6.4%,非期货部分约0.2%。期货盈利还包含约2.9个百分点现金/保证金收益;统一风险后,当年他的25.9%又低于两项CTA参照约30%的表现。漂亮的账户收益,需要先拆账户边界、资金收益和风险,才能判断策略是否出色。

它到底在问什么?

个人系统化交易者一年赚了多少,究竟应看期货策略、整个账户,还是承担同等波动后的相对表现?

作者具体怎么做?

  1. 主要个人年度采用英国税年4月6日至次年4月5日;部分基准表另用3月底区间,比较时必须检查日期是否一致。
  2. 期货价格盯市收益约21.7%,扣管理相关费用0.04%、佣金0.33%、滑点0.55%,得约20.7%;再计约2.9%资金收益后约23.7%,存在显示舍入。
  3. 分资产归因,股票和金属各贡献约5.49个百分点,农业约3.89,债券拖累约2.84;这些是对组合收益的贡献,而非各资产自身回报。
  4. 作者同时展示原始收益与波动率调整后的对照,长期均值/标准差与复合增长率分列,不能把算术平均收益直接当CAGR。

关键结果

原文结果与口径
核对项结果意味着什么
总体 / 期货账户6.4% / 23.7%不同资产范围,不是同一组合的两种算法。
滑点估计0.55%作者相对市场单约1.34%的对照,未独立核验成交日志。
当年风险调整收益25.9% vs 30.3% / 29.9%作者与AHL/SG参照;原始高收益不等于同风险领先。

怎么理解?

这类实盘复盘的研究价值,在于它把平时容易被省略的资金收益与执行成本单独列出。研究员可以据此检查自己的回测是否也包含现金利息、换汇和保证金管理,而不是只比较净值曲线。 不过,风险缩放不是完全公平的胜负判决:同波动仍可能有不同偏度、资产机会集和风险上限。一年的股票、金属贡献较高,也不能据此确定下一年加配这些市场。应追问收益来自稳定规则还是恰好遇到有利行情,并在持仓和交易层核对归因。

最大限制

数据由作者披露,未见独立审计;税年与日历日期不同,一处表头还出现晚于文章日期的4月底标签,不能解释为当时已实现的未来收益。滑点反事实依赖市场单价格模型,节省金额不等于任何交易者都能复制。

复现与研究价值

建立一张月度对账表,逐项连接盯市、佣金、滑点、现金利息、汇兑和资金进出;另列统一日期、统一波动的基准,不让风险或现金处理代替策略能力。这是建议,未重建作者账户。

原文与核查

公开年度复盘和数值表已读;未核验私人交易记录。

原始文章 ↗

推荐 81/100 · 问题 26/30 · 证据 23/30 · 方法 23/25 · 复现 9/15

真实账户边界与费用拆解有价值,独立核验和基准可比性有限。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 组合研究

最优叠加组合年化多2个百分点,但跟踪误差7.8%可能先逼投资者退出

What's the Optimal Stack?

Return Stacked Portfolio Solutions

一句话先讲结论

文章用一万条重抽样历史优化股票、债券、黄金、CTA和并购套利,得到约195%名义敞口的组合,模拟中位年化7.3%,高于60/40的5.3%;但相对基准跟踪误差约7.8%,不少一年区间显著落后。核心不是照抄最优仓位,而是把能承受多久跑输基准,写进组合目标和约束。

它到底在问什么?

当分散资产需要额外杠杆叠加时,研究员应追求最高模拟收益,还是在融资、跟踪误差与持有耐心之间选择可持续组合?

作者具体怎么做?

  1. 正文重抽12个月区块,生成一万条25年历史,保留区块内时序与同月跨资产关系,但不能生成历史从未出现的制度冲击。
  2. 各模拟内选择在60/40风险水平附近最大化几何收益的多头组合,超过100%的敞口按国库券收益加50bp融资,再平均最优权重。
  3. 另固定60/40基础组合和20%叠加,比较黄金、CTA、并购套利单项与等权/逆波动混合;后者用此前36个月波动率,每月更新。
  4. 进一步按稳定超额收益或危机保护优化,目标不同得到不同权重;页面互动工具采用2000次、26年及不同重抽样说明,不能与正文实验不加区分地混用。

关键结果

原文结果与口径
核对项结果意味着什么
模拟中位年化7.3% vs 5.3%不同组合在作者收益假设下的模拟统计,不是未来收益承诺。
20%逆波动混合叠加TE 1.23%,IR 0.47相对基准统计,IR不是整个组合夏普。
最差12个月相对收益平均约−1.9%每条模拟最差值再取平均,不是损失下限或95%风险分位。

怎么理解?

最有用的转变,是把“我相信分散化”改成可检验的约束:最多接受多少持续跑输、追加保证金和融资压力。跟踪误差可以帮助预算偏离程度,但并不能代表最坏尾部或持有期限。也不能把客户一般能忍受2%—3%的经验判断,当普适的统计结论。 一万次模拟主要减少对历史顺序的依赖,并不减少对预期收益假设的依赖。若并购套利被赋予更高前瞻夏普,优化器多配它有一部分是输入假设的结果。研究员应先看假设改变时权重是否剧烈变化,再看单一最优数值。

最大限制

指数无法直接交易,融资和额外产品费可能与假设不同;危机相关性与保证金需求也未被简单月度重抽样充分捕捉。发布方经营相关产品,属于有商业背景的研究。标题权重为舍入数,合计不应据此精算实施订单。

复现与研究价值

以自己的基础组合和真实融资条件,将收益均值、融资利差和危机相关性作为压力情景;报告持有期间跑输长度、追加保证金和最差分位,而不仅是均值TE。最后与简单等权叠加比较,未执行该实验。

原文与核查

公开正文、结果表及模拟说明已读;未运行网页工具或独立复算。

原始文章 ↗

推荐 81/100 · 问题 28/30 · 证据 21/30 · 方法 23/25 · 复现 9/15

目标约束和融资分解有实用价值,模拟对主观均值及指数历史依赖较大。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 季节性研究

税日季节性曾经很强:45笔交易净赚11,851美元,但近年优势已明显变弱

A Historical Look At $SPX on Tax Day

Rob Hanna / Quantifiable Edges

一句话先讲结论

1981—2025年在税日附近做多SPX,作者图表中的45笔交易胜率64.44%、利润因子2.26、累计净利11,850.74美元;但这是每年一次的季节性小样本,作者也明确说近年表现已不如过去。IRA缴款形成资金流是合理假说,不是这45笔交易已识别的因果机制。

它到底在问什么?

美国报税截止日前后的IRA缴款和资金入市,是否形成可以提前交易的SPX短期偏差?

作者具体怎么做?

  1. 样本覆盖1981—2025,每年一次,共45笔;图中以每笔100,000美元为单位绘制权益曲线。
  2. 统计报告总净利、毛利、毛损、利润因子、胜率和平均盈亏,假定的进出时点和费用仍需读取作者完整规则。
  3. 作者将IRA缴款和基金经理立即配置资金作为可能机制,同时展示曲线近年趋弱;他明确说这不再是过去那样的‘layup’。
  4. 这更像季节性提醒而不是完整策略论文,图表本身不能区分税日效应、星期效应和长期牛市漂移。

关键结果

原文结果与口径
核对项结果意味着什么
交易笔数 / 胜率45 / 64.44%跨45年每年一次,统计独立性与稳定性有限。
利润因子 / 净利2.26 / $11,850.74图表回测值,不等于扣除所有可执行成本后的投资收益。
最大单笔盈亏+$3,322 / −$2,262集中度较高,平均值受少数年份影响。

怎么理解?

这篇的正确用途是把“季节性还剩多少”列入事件前检查,而不是自动在4月15日买入。尤其当资金流机制没有账户级数据时,价格优势可能是长期趋势、节日效应或历史制度环境的合成。作者主动承认近期变弱,反而比只展示累计曲线更值得重视。 小样本季节性最容易被复合收益图说服。研究员应列出逐年收益、事件日期是否顺延、交易时点与成本,再做滚动年代检验;45次不足以放心估计尾部。

最大限制

正文很短,未给出逐笔交易时间、完整费率和样本外冻结规则;IRA税法和缴款行为也可能变化。图表资金规模是示意,不把$11,850当可按任意本金线性复制的承诺。

复现与研究价值

将税日与相邻非税日、星期几及市场趋势做匹配事件研究,按年代留出近十年;报告净收益、最大回撤和成本敏感性。若效应只在早期存在,应把结论写成历史事实而不是现行信号。未执行。

原文与核查

公开正文、图表和统计摘要已读;未取得逐笔交易数据。

原始文章 ↗

推荐 65/100 · 问题 23/30 · 证据 19/30 · 方法 15/25 · 复现 8/15

数据口径直观且作者承认衰减;样本小、规则细节和机制验证不足。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 论文导读

把过去12个月拆成财报日与非财报日:动量收益中约一半来自公司特定信息窗口

The Many Facets of Stock Momentum: Distinguishing Factor and Stock Components

Elisabetta Basilico;原论文 Gerard / Jehl

一句话先讲结论

论文把个股过去12个月收益拆成财报公告前后±2日的收益与其余收益:美国大型股中,财报事件部分的动量策略年化平均收益约3.51%(近15年4.90%),低于传统动量的波动,却保留预测力;短期最新财报策略近15年仅1.15%、t值0.67。动量里有公司特定信息成分,但不能因此把3.51%当成已扣成本的PEAD。

它到底在问什么?

传统个股动量到底是行业/市场共同走势,还是公司在财报信息窗口的特异反应逐步被消化?

作者具体怎么做?

  1. 样本来自IBES财报日期、Worldscope财务数据和Datastream价格;美国、欧洲、日本分别取最大1000/400/200家公司,收益换算美元。
  2. 每月底用过去一年所有年度与中期财报公告日期,在每个公告前后两日累计市场/行业调整收益;信号按横截面去均值和绝对值缩放为100%多空。
  3. 将策略暴露分解为财报窗口、非窗口及市场均值,并用行业、市场beta、规模、价值、盈利和投资因子做动态横截面归因。
  4. 美国全样本1992—2024,欧日因数据从2003/1998等时点起;同时报告最近15年和不同地区结果。

关键结果

原文结果与口径
核对项结果意味着什么
美国12M EAR:全样本 / 近15年3.51% / 4.90%年化平均收益,不是CAGR;一向换手约430%。
最新财报策略近15年1.15%,t=0.67最新事件信号在大盘股中没有显著预测力。
EAR波动 / 换手7.91% / 430%单边波动看似低,但交易成本和借券费用仍需计入。

怎么理解?

论文把“动量”从一个总分拆成事件窗口和剩余路径,这是比再换一个动量回看期更有解释力的设计。财报窗口收益更像公司特异信息的可观测代理,因此行业中性和动态因子归因后仍有收益,才更接近个股信息滞后。 但事件窗口不是纯粹的公司信息:市场开盘跳空、行业公告和事件日期披露误差都会进入±2日。近15年传统最新财报策略已消失,也提醒不能用旧PEAD文献替代当前交易成本和容量审查。

最大限制

原始I/B/E/S、Worldscope、Datastream需权限,未逐行重建;财报日期分布和地区数据覆盖存在断点。文章提供的是大盘股多空研究,不直接代表A股个股,且15年结果仍非未来保证。

复现与研究价值

在A股用公告首次披露时间而非财报期末,构造±1/±2/±3日事件窗口,分离行业与市场收益并计算换手、涨跌停和融券可得性;先复现EAR分解,再比较传统动量。未执行。

原文与核查

Alpha Architect导读及公开FAJ论文关键方法、表1—2已读;未取得原始数据。

原始文章 ↗

论文PDF

推荐 86/100 · 问题 29/30 · 证据 25/30 · 方法 24/25 · 复现 8/15

事件分解和跨市场比较扎实,数据权限与交易成本限制直接部署。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 研究博客

战术收益率:久期补偿不够就持现金,50% 是历史分位而不是收益率阈值

Meb Faber's "Tactical Yield", Simple and Intuitive

Allocate Smartly;策略提出者 Meb Faber

一句话先讲结论

每个月分别判断“10 年国债收益率−3 月国库券收益率”和“投资级公司债收益率−3 月国库券收益率”是否高于各自当时历史中位数;超过就给对应债券 50% 仓位,否则把那一半留在现金。作者把分位门槛从 30% 测到 70%,发现更严格并非更好:风险下降,但收益和夏普也会变差。它是在选择风险补偿,不是在精准预测下月利率。

它到底在问什么?

既然短期国库券也有收益,什么时候值得承担长久期和信用风险?策略试图用相对现金的收益率补偿约束持仓,而不是只追随债券价格趋势。

作者具体怎么做?

  1. 月末计算两个收益率差,分别与截至当时已观察到的自身历史分布比较。基准规则采用扩展历史中位数,不是拿今天的全样本中位数回填过去。
  2. 国债利差超过门槛就配置 50% IEF 代表的国债风险,公司债利差超过门槛就配置 50% LQD 代表的公司债风险;因此总债券仓位可以是 0%、50% 或 100%,剩余为现金。次月末重新判断并再平衡。
  3. 平台从 1930 年开始测试,正文称计入交易成本;再比较历史长度和 30%、40%、50%、60%、70% 分位门槛。早期不是 ETF 实际交易记录,作者承认历史数据来源差异会影响结果。

关键结果

原文结果与口径
核对项结果意味着什么
开仓门槛历史 50% 分位利差的历史相对位置;不是利差达到 50 bp,也不是债券收益率 50%。
每条风险腿仓位50%两项判断独立,未配置部分持现金。
门槛敏感性30%—70%更严格减少风险,也会牺牲收益和风险调整表现;没有报告处处更优。

怎么理解?

“只有补偿足够才承担风险”是一个容易解释给组合经理听的规则。但这里的期限溢价只是长短收益率差,不是剔除了未来短率预期的学术期限溢价;公司债减国库券也同时含期限和信用成分。因此不能把两条信号当作已干净分离的久期与信用预测因子。 读它还要避免一个跨期限跳跃:起始收益率与长周期债券回报相关,不自动推出历史分位能预测下个月。本文月度开关的依据需要依靠策略对照,而不是用长期收益可预测性代替。最需要补的是相同平均债券仓位、相同久期预算下的比较,才能区分择时价值和单纯减风险。

最大限制

1930 年以来数据包含 ETF 成立前的重建历史,不能看成九十多年可直接买卖的产品记录。本次未逐图核验收益统计和全部成本参数。美国利率制度跨度很大,跨时代历史分位并不保证适合短样本市场。

复现与研究价值

迁移当前国内样本时,不照搬几十年回看。先在实际可用样本内固定合理的扩展或有限窗口,设最短训练期;与相同平均久期的固定组合、价格趋势规则对照,再做 40%/50%/60% 门槛敏感性。这里是研究建议,未实施回测。

原文与核查

已核对公开文字中的规则、阈值敏感性和历史数据说明;未逐图或重跑全部绩效。

原始文章 ↗

推荐 79/100 · 问题 26/30 · 证据 20/30 · 方法 22/25 · 复现 11/15

规则简单、参数解释清楚,适合检验风险补偿择时;长期重建数据与久期混合口径需要谨慎。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

稀疏策略怎么配仓:先问给底仓增加了什么,不要把零重叠误认成零风险

When Correlations Fail: A Bayesian Approach to Sizing Sparse Overlays

Beyond Passive Investing

一句话先讲结论

在 SPY、TLT、GLD 逆波动底仓上,把 8 个季节性策略各按 10% 叠加,报告夏普从 1.01 升至 1.31;但 FOMC 策略在自己的活跃日与底仓回归,R² 高达 0.903,几乎没有独立截距。进一步按增量收益与尾部表现调权能改善组合,不过所谓“贝叶斯”主要是人工先验与置信门控,不是完整后验推断。

它到底在问什么?

一年只交易几天的策略,彼此几乎没有同时持仓的样本,怎么判断它值得配多少?作者把问题改成:在它实际交易的那些日子,它给每天都在运行的底仓增加了什么。

作者具体怎么做?

  1. 在每个卫星策略的活跃日,用它的收益对底仓收益回归,得到截距 Alpha、斜率 Beta 和剩余波动;非活跃日不用于这个条件回归。
  2. 以 Alpha/剩余波动衡量增量收益质量,用扩展历史更新估计。每条策略初始权重 10%,belief=0.25,回归调整强度 0.70;截距 t 值从 0 增至 2 时,置信门逐渐打开。
  3. 再检查底仓最差 5% 日子的卫星表现,给有防御贡献的策略正向加权;尾部样本达到 30 个才充分信任,调整强度设 0.10。作者声明参数凭判断设定、并非拟合,但未提供前瞻登记证据。
  4. 报告计入每股佣金及最低佣金、闲置现金利息、杠杆部分按联邦基金利率加 1.5% 融资。这个口径不能自动覆盖滑点、特殊借券和冲击等所有成本。

关键结果

原文结果与口径
核对项结果意味着什么
先做简单等额叠加Sharpe 1.01 → 1.31先拿到大部分直观分散收益,再讨论复杂权重的增量。
FOMC 对底仓的解释比例R² = 0.903条件线性相关很高;不是证明所有时点择时价值为零。
尾部加权的边际改善Sharpe +0.05回撤 −16.1% → −15.0%;效果需对照新增参数与权重集中。

怎么理解?

这篇最好的问题是“它给现有组合增加什么”。高独立夏普的策略,可能只是在特定日子加了一倍底仓;低相关策略,也可能仅仅因为大部分时间收益记为零。条件回归把这两件事区分得更清楚。 但原文把 Alpha/残差波动叫 IC,和选股研究里常用的预测值—未来收益相关系数不是同一指标;其调权也不再等同于经典 Treynor–Black 的 Alpha/残差方差。分母从方差变成波动,排序与风险缩放都会改变,不能仅靠常数吸收。 我也不会接受“协方差矩阵不适用”的绝对说法:按全日历把空仓收益记零,仍能估计实际组合 P&L 的协方差;困难是样本误差、条件依赖与未来是否继续不重叠。相对底仓回归是有用的补充,不是免除共同尾部风险检查。

最大限制

季节性策略本身有样本选择,活跃日回归不能消除它。只正向奖励尾部贡献、不惩罚额外非线性下行的规则并不对称。尾部均值和 t 值都需要尊重重叠窗口与时间依赖,本站未重跑。

复现与研究价值

对于当前较短的 A 股策略样本,别为了凑尾部样本硬上十几年窗口。先采用保守等额风险预算或强收缩权重,把残差收益、活跃占比、共同亏损日期一并报告;复杂尾部加权只有在独立样本确实增加价值时才保留。

原文与核查

公开正文、图注统计和调权说明已核对;公式图片未完整转录,代码与底层数据未独立验证。

原始文章 ↗

推荐 81/100 · 问题 28/30 · 证据 21/30 · 方法 24/25 · 复现 8/15

对稀疏策略的条件增量评价很实用;指标命名和方法等价性需要纠正,复杂权重仍待独立验证。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 观点评论

趋势还是反转不是关键,关键是收益由谁的行为提供

To Trend or Not To Trend? (Wrong question)

Kris Longmore

一句话先讲结论

这不是一篇证明趋势优于反转的实证论文。作者的判断是:同样的跌后反弹,可能来自强制平仓、杠杆产品再平衡或机构配置调整;只有把具体交易行为与可检验预期对应起来,模式才有研究意义。先看见漂亮回测、再补一个永远不会错的故事,并不会增加证据。

它到底在问什么?

“做趋势”与“做均值回归”描述价格怎么走,却没解释为什么有机会。研究员更应问谁需要交易、为什么不完全在意价格,以及自己为什么还能参与。

作者具体怎么做?

  1. 把相似的价格形态拆成不同成因:保证金压力导致的卖出、杠杆产品为恢复目标杠杆而交易、机构偏离目标权重后的再平衡。它们的可观察时点、流量和持有期应不同。
  2. 对趋势,作者讨论信息反应不足和估值锚不清晰等解释,但承认其机制比已知的机械流量更模糊;这是作者的研究偏好,不是本文实证排名。
  3. 立项前用三个问题约束假说:什么造成机会、为什么没有被更快交易者完全吃掉、具体如何交易;再检查预期是否在数据中出现,并考虑机制消失的条件。

关键结果

原文结果与口径
核对项结果意味着什么
材料性质研究方法评论读它是为了改善立项与验证,不是获取现成收益参数。
关键区分价格模式 ≠ 经济机制同样的统计形态可能包含完全不同的交易机会。
新增实证收益未报告原文没有提供,不编造结果。

怎么理解?

它对研究员的直接价值,是迫使机制产出可以被推翻的预测。如果认为收益来自再平衡,效果就应随预计调仓规模、窗口和流动性变化;如果这些地方都不变化,故事的解释力就值得怀疑。 但我不会把“先有故事”当成研究合格证。一个先写好的故事也可能错,发现数据模式后再提出机制也并非天然无效。真正的分界是发现后的验证是否独立、是否记录搜索过程、是否允许结果否定自己。原文强调机制是合理的,读者仍需要把它落实成对照实验。

最大限制

这是一位从业者的研究观,不提供机制的因果识别或策略强弱证据。价格不敏感对手方的存在也不保证可获利:时点、容量、拥挤和成本仍可能吃掉全部优势。网页当前日期晚于目录收录日,保留两者差异,不自行修正来源。

复现与研究价值

每个研究立项增加四行:预期收益来自谁;哪项数据能观察其行为;哪组对照不应出现收益;出现什么结果就否决。让 LLM 帮忙列反证,不只生成支持性解释。

原文与核查

公开正文已读;性质为观点评论,没有可复现收益实验。

原始文章 ↗

推荐 70/100 · 问题 26/30 · 证据 12/30 · 方法 23/25 · 复现 9/15

研究约束清晰、可立即用于团队流程;但观点文章没有新增实证,不能当作策略有效性的证据。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 工作论文导读

因子过去一个月出现最大单日上涨,之后高MAX组每月多0.32%;但这是因子择时,不是个股信号

Factor MAX: A New Signal for Predicting Factor Returns

Liyao Wang / Ming Zeng

一句话先讲结论

1963—2023年172个因子中,按上月最大单日因子收益分五组,最高组下月0.41%、最低组0.09%,H−L为0.32%/月(t=5.89);控制五因子、因子动量和个股彩票特征后,Alpha仍为0.24%—0.37%。它检验的是“买高MAX因子、卖低MAX因子”,不是把个股最大涨幅直接当买入信号。

它到底在问什么?

一个因子在月内突然大涨,是已经过度反应,还是因子层面信息尚未被充分吸收?

作者具体怎么做?

  1. 数据来自Open Source Asset Pricing的连续因子,剔除7个彩票类因子,保留172个因子,1963—2023连续覆盖。
  2. 每月按过去一个月最大日收益排序五分位,买P5卖P1;下月因子收益等权,报告均值、夏普及CAPM/FF5/FF5+MOM/HXZ/DHS Alpha。
  3. 通过跨度回归控制时间序列和横截面因子动量,并控制个股MAX、偏度、特异波动等异常。
  4. 按注意力、极端宏观新闻及财报月双重分组;低注意力MAX约0.42%/月且显著,高注意力不显著;因子MAX在事件后至少30日延续,个股MAX则回撤。

关键结果

原文结果与口径
核对项结果意味着什么
P5−P1月均收益0.32%,t=5.89因子层级多空收益,非个股组合年化Alpha。
五模型Alpha0.24%—0.37%/月控制模型不同但仍显著;样本期长且因子库定义仍重要。
低注意力组0.42%/月,t=2.93注意力机制的条件支持,不是实时注意力可直接交易的证明。

怎么理解?

它最有意思的地方是把“极端收益后的反转/延续”从个股提升到因子层面:同样的显著日收益,聚合到因子可能代表系统性信息,投资者反而低估其持续性。因而不能把个股MAX文献机械套到因子组合。 不过172个因子不是172个独立经济风险,因子之间高度相关,等权P5可能集中在少数共同主题。研究还在已知因子库上选规则,不能把随机抽样的显著性当作完全免疫数据挖掘。实际交易还需把因子收益映射到可交易股票权重和容量。

最大限制

原始因子构造与可交易成本未在本站复现;会议稿和SSRN版本存在更新。研究只到2023年,注意力代理、极端事件日和因子可得性可能产生后视或样本选择。

复现与研究价值

在本地因子库先固定发布日期和可交易权重,按因子相关性聚类后做MAX信号;将P5−P1拆成行业、规模和成交成本贡献,并留出近十年滚动样本外。未执行。

原文与核查

导读及公开会议论文关键方法、表格和附录图已读;未下载完整研究数据。

原始文章 ↗

会议论文PDF

作者研究页面

推荐 87/100 · 问题 29/30 · 证据 25/30 · 方法 24/25 · 复现 9/15

主结果、控制和机制检验丰富,且明确区分因子与个股;落地成本与因子相关性仍需实证。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

新兴市场与美国轮动:均线组合年化 7.13%,但别把价差择时当成风险中性 Alpha

Systematic Tactical Allocation in Emerging Markets vs. U.S.: A Momentum-Based Approach

Cyril Dujava / Quantpedia

一句话先讲结论

1997—2026 年新兴市场相对美国的价差长期走弱,但按均线信号双向切换后,多窗口组合报告年化 7.13%、文中夏普 0.564、最大回撤 −20.31%。看起来比一直做多新兴市场价差好很多;不过这不是同风险的持有美国股票基准,而且“等金额多空”也不等于 Beta 中性,尚不能把全部收益称为 Alpha。

它到底在问什么?

何时应该超配新兴市场、低配美国,而不是永远押注某一个市场?作者测试相对表现本身是否具有中期趋势,不依靠人工判断美元或地缘政治拐点。

作者具体怎么做?

  1. 使用 1997 年 2 月至 2026 年 2 月月度数据,新兴市场为 MSCI EM,美国为 S&P 500/SPY。以两者相对表现构造多空价差,测试 ROC 动量和 SMA 均线方向。
  2. 分别统计只做价差多头、只做价差空头和双向切换;ROC 测试 1、2、3、6、9、12、24 月,SMA 测试 2、3、4、5、6、9、12、24 月。每个窗口需要先积累信号历史,因此起始日期会不同。
  3. 把多个回看窗口的策略平均成组合,排除最长窗口。原文公开表格列出各变体收益、波动和回撤,但完整信号公式在网页中的数学图形未由本站还原,交易账本和执行成本未取得。

关键结果

原文结果与口径
核对项结果意味着什么
SMA 多窗口双向组合7.13% / 0.564年化复合收益/文中夏普;成本与资金口径未完整说明。
ROC 多窗口双向组合5.69% / 0.497与 SMA 相比收益较低,但回撤略小,不是每个指标都落后。
SMA 24 月双向变体回撤−78.33%最长窗口表现显著恶化;组合排除它是否事先决定,是重要审计项。

怎么理解?

最有价值的是多参数组合相对单一最优点的比较:它没有拿到最高收益,却降低了波动。但排除最差的最长窗口会带来新的选择问题——参数平均只有在参数集合也事先冻结时,才能真正减少回看择优。 表格还有一个值得注意的口径:7.13% 除以 12.64% 正好约等于 0.564,显示文中“夏普”至少数值上采用 CAR/波动,而非常见的平均超额收益/波动。比较其他论文之前需统一公式。另有正文称 ROC 空头 9 月夏普最好,但表 1 的 1 月 0.407 高于 9 月 0.332;这里以表中数字为准,不照搬正文概括。

最大限制

没有独立样本外结果和完整成本说明。不同参数起始日期变化、价差净值定义、融资与卖空成本、汇率暴露和两腿 Beta 不同都影响比较;不能把两腿收益差直接当作普通 ETF 净值。

复现与研究价值

复现时先明确交易工具与资金占用,再同起点比较:固定美国超配、静态两市场配置、单窗口、包含全部候选窗口的平均组合。冻结 6/9/12 等少量可解释窗口后检验,而不是根据全样本表现删掉 24 月。A 股研究可借鉴相对指数轮动设计,但不是个股动量边界论文的替代复现。

原文与核查

已核对正文和 HTML 结果表;指出表文差异,未执行回测或恢复全部公式图形。

原始文章 ↗

推荐 76/100 · 问题 25/30 · 证据 20/30 · 方法 21/25 · 复现 10/15

参数表充分且易发现反例;夏普公式、基准、成本与窗口排除尚不清楚,降低证据评价。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 研究博客

增长×通胀行业轮动:年内涨 39%,但不是全天候,更可能夹带市场 Beta

David Varadi's "Growth and Inflation Sector Timing", a Wildcard Strategy

Allocate Smartly;策略提出者 David Varadi

一句话先讲结论

这套增长×通胀轮动策略在文章写作时报告 2026 年内上涨 39%,却在 2025 年出现过约 24% 的月末口径回撤,且自 2008 年起没有跑赢大盘。原因不难理解:它任何时候都只持有一个股票行业;更关键的是,用周期行业相对防御行业构造的“通胀预期”还混入了市场 Beta,并非纯粹的通胀信号。

它到底在问什么?

不用滞后的 CPI,能否直接从行业价格判断增长和通胀状态,再轮动到最受益的行业?文章的价值在于提出可交易的价格代理,也暴露了代理变量究竟测到什么的问题。

作者具体怎么做?

  1. 用 S&P 500 的当前趋势代理前瞻增长;把能源、工业、金融、材料放入正通胀敏感组,把公用事业、医疗、必选消费放入负敏感组,以两组组合价格之比构造行业隐含通胀指标。
  2. 按增长与通胀指标的升降切成四种状态,并持有对应的一个行业 ETF。网页文字明确增长上升/通胀下降对应科技 XLK,二者上升对应能源 XLE;其他映射与精确趋势规则未在本次读取的文字中完整披露,不能据此宣称已取得可复现规则。
  3. 平台测试的是降低换手后的改版,日末判断状态并假定日末成交,平均每年不到 6 次持仓切换。单边摩擦假设 0.1%,往返 0.2%;历史测试从 1991 年起。

关键结果

原文结果与口径
核对项结果意味着什么
写作时的年内收益+39%截至 2026-04-06 文章口径,既不是全年收益,也不是截至今天。
2025 年回撤约 −24%月末采样口径;不能当作逐日最大回撤上限。
与 S&P 500 月收益相关性0.60可能有分散价值,但不代表低风险或市场中性。

怎么理解?

真正值得研究的是价格能否及时反映宏观,而不是“四象限”这个名字。周期行业相对防御行业既含通胀信息,也含风险偏好、市场 Beta 和行业特有冲击。平台自己发现正通胀组的市场 Beta 更高,这使所谓通胀择时有一部分可能只是股票风格择时。 因此,年内上涨 39% 不能压过长期相对收益和回撤证据。作为小比例股票替代项,它可能带来不一样的持仓路径;作为完整资产配置方案,它缺少分散风险资产的机制。文章关于 Beta 调整后表现改善的说法值得跟进,但没有在正文给出改善幅度,本解析不把它写成已验证的新策略。

最大限制

未取得完整映射和趋势参数,1991 年以来行业数据的拼接也未独立审计。用日末信息又按当日收盘成交需要验证可执行性。策略选择和平台改版可能有回看选择,相关性和近期收益都不是未来稳定性的保证。

复现与研究价值

优先比较原始行业比值、滚动 Beta 调整后的比值、直接通胀预期代理三种信号;控制相同风险和换手后,再检验行业收益增量。A 股应重新估计行业敏感度,不能照抄美国能源与科技的状态映射。

原文与核查

已核对公开正文及文字统计;完整图表映射、参数和原始回测未审计。

原始文章 ↗

推荐 74/100 · 问题 25/30 · 证据 20/30 · 方法 21/25 · 复现 8/15

行业价格代理与 Beta 污染问题有研究价值;规则披露有限,集中风险与长期相对收益削弱策略直接采用价值。

返回全年目录 ↑

Quantocracy / Word 标准 · 材料受限,不计完整解析 / 论文导读

LLM 会按角色下单,不等于会赚钱:模拟市场也纠正不了所有高估

Large Language Models in Trading: Models and Market Dynamics

Harbourfront / rvarb;相关研究 Alejandro Lopez-Lira 等

一句话先讲结论

这篇导读把两件事放在一起:用 RAG 辅助交易、让 LLM 在模拟市场互相交易。后者的原论文更值得细看:8 个 GPT-4o 代理面对价值 28 的资产,从价格 14 出发会向价值靠近,但从 56 出发,15 轮后仍明显高估。会遵循投资者角色,不等于能够自动纠正错价,更不是实盘盈利证明。

它到底在问什么?

LLM 是作为外部研究助手提供信号,还是自己进入订单簿成为交易对手?前者要检验预测增量,后者要研究行为与市场反馈。把两者统一写成“AI 交易有效”,会漏掉最重要的证据边界。

作者具体怎么做?

  1. RAG 书章提出把价格等数值与新闻等文本结合,通过检索相关材料辅助模型。出版社公开页没有可核对的样本、基准和收益表,不能由“显著改善”的摘要描述补出数字。
  2. 市场模拟论文使用带限价单、市价单与部分成交的订单簿,让不同角色的 GPT-4o 代理提交结构化决策;设置明确的股息与资产价值,观察价格发现,而不是直接回测真实股票。
  3. 无限期情景保持价值 28 不变,分别从价格 56 与 14 启动,观察 15 轮。论文报告低估得到纠正、高估持续;交易成本设为零,结果用于理解模拟行为。

关键结果

原文结果与口径
核对项结果意味着什么
低估情景14 → 向 28 收敛定性结果来自论文正文;没有转录未核对的图中终值。
高估情景56 → 15 轮后仍高估同一模型群体不保证对称地消除错价。
RAG 交易绩效未报告书章全文受限,不能把摘要主张当已核验收益。

怎么理解?

我认为这组材料最大的提醒是:角色服从、估值计算、交易获利和市场稳定,是四个不同的目标。代理忠实扮演乐观投资者,即使持续高估,也可能是提示词执行成功、经济决策失败。用“像投资者”评价系统,和用“收益与风险”评价系统,得到的答案可能相反。 同样,市场产生泡沫不自动证明 LLM 特有的系统性风险。还要在相同规则下比较传统规则代理、不同底座模型,以及相同模型但不同真实信息的代理。真正需要分离的是:角色差异、信息差异和模型差异各自带来多少行为多样性,而不是把角色数当独立意见数。

最大限制

模拟是小规模、人工设定的市场,不能用来量化真实市场未来波动。论文正文核查不等于代码重跑;本篇引用的另一项 RAG 书章仍只有摘要。上述模拟阅读采用当前可访问文本,不保证与 4 月导读当时所见版本完全相同。

复现与研究价值

适合构建 LLM 投研系统的行为测试:固定信息,仅改变措辞,测仓位是否发生不合理跳变;固定角色,改变一条基本面证据,测决策是否响应;再跨底座模型比较相关性。先检验信息响应与风险约束,不把自然语言推理写得通顺当作交易能力。

原文与核查

已读导读;核对 arXiv 当前可读正文的实验设定与结论;RAG 书章仅摘要,故整条仍列材料受限。

原始文章 ↗

市场模拟论文原文(arXiv)

RAG 书章原址(Springer,仅摘要可读)

推荐 76/100(暂定) · 问题 27/30 · 证据 18/30 · 方法 23/25 · 复现 8/15

模拟可帮助检验多代理行为,但 RAG 书章未获全文;暂定分只基于已核查部分。

返回全年目录 ↑

Quantocracy / Word 标准 · 材料受限,不计完整解析 / 研究博客

稀释、de-SPAC 与违约做空:事件时点可定义,收益却还不能从公开预览确认

A Junior Quant's Guide to Event-Driven Trading

Quant Galore、Alphanume Research

一句话先讲结论

公开部分提出:收集增发稀释、de-SPAC 和违约事件,事件记录后延迟一个完整日再做空,持有一个月。它明确改善了“知道事件就假设立即成交”的回测口径,但收益统计出现在付费墙之后;目前只能评价设计,不能说这三类事件已经提供了可实现 Alpha。

它到底在问什么?

价格模型容易被公司事件打断,那是否可以直接把事件当信号?作者选的是供给增加、上市转换和偿付困难这些可能持续施压的情形,而不是泛泛做公告情绪。

作者具体怎么做?

  1. 定义三类事件:增发稀释、SPAC 完成并购转换为经营实体、违约/破产等困境事件。它们的经济机制不同,不能只按共同下跌标签混为一个样本。
  2. 按事件日期与时间构建历史记录。作者强调事件可获知时点与策略可成交时点并不相同,提出留出一整日执行延迟。
  3. 公开部分计划做空并持有一个月;后续模拟结果不可见,样本范围、组合构建、重叠事件处理、借券成本和回测收益都未取得。

关键结果

原文结果与口径
核对项结果意味着什么
事件类型3 类不同经济机制需要分组验证,不是三条已证实盈利策略。
执行延迟一个完整日能降低过度乐观成交假设,但不能修复错误的事件数据库时间戳。
收益与风险结果未报告付费墙之后,不能依据文章语气推测。

怎么理解?

对研究员最有用的是事件账本的思路:不仅记录发生了什么,还要记录市场什么时候能够知道、策略什么时候可以买卖。延迟成交是保守处理,但不是防未来信息的万能补丁。如果供应商后来回填了早期事件标签,延迟一天依然可能用了当时不存在的数据。 另一个重要区分是“事件后继续下跌”和“事件后可以赚钱地做空”。困境股票可能没有券、被召回或暂停交易,尾部损益也不能简单按最后价格退出。上市公司增发还会同时带来现金;稀释比例本身不是等量价格损失,更不能单凭机械稀释叙事预测收益。

最大限制

完整付费研究未读取,不能核验样本、显著性、费用或卖空可得性。预览中的机制解释只是假说,不是实证结果。

复现与研究价值

取得正文前,不把本文作为立项收益依据。若做 A 股研究,先从可实现的多头规避或风险过滤评估事件增量,而不是假设能普遍融券做空;用首次公告时点、行业市值匹配对照和退市后收益处理构建事件研究。

原文与核查

仅公开预览已读;模拟结果位于付费墙后,未获取,不计新版完整文章解析。

原始文章 ↗

推荐 51/100(暂定) · 问题 22/30 · 证据 7/30 · 方法 18/25 · 复现 4/15

仅评价公开方案的启发,付费结果尚不可核查;不是对完整文章质量的最终评分。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

月末交易:先分清债券季节性和股债反转,再剔除没跑赢随机窗口的腿

Two Calendar Effects at the Month Boundary

Beyond Passive Investing

一句话先讲结论

作者把股债月界交易拆成四条候选腿,发现“股强债弱后,下月初买股票”虽有正收益,但在 10,000 次随机 5 日窗口比较中,p 值为 0.068,没过 5% 门槛,因此删掉。剩余三条组成的低仓位叠加策略报告年收益约 2.2%—2.8%;不过样本内筛选、信号与持有窗口可能重叠,以及未计滑点,仍需要补查。

它到底在问什么?

月末债券上涨,是无需条件的季节性,还是机构把上涨资产卖掉、补回落后资产的再平衡?如果两者混在一起,既可能误读收益来源,也可能把股票自身的正漂移当成择时能力。

作者具体怎么做?

  1. 使用 2002 年 8 月至 2025 年 6 月 VTI、TLT 实际 ETF 数据,共 273 个月。先按月初和月末分别排列交易日,扫描 1—7 日持有窗口,最后统一采用 5 日。
  2. 以前 15 个交易日 VTI−TLT 收益差的正负区分股强或债强。候选是:月末无条件买 TLT;债强时月末买 VTI;股强时下月初买 VTI或做空 TLT。
  3. 对每条候选,从同一标的随机抽取等量 5 日收益窗口,重复 10,000 次比较几何平均收益。月初买 VTI 没过 5% 门槛,被排除;其余三条进入组合。
  4. 版本 A 每条腿用组合资金的 20%,债强时月末两条多头重叠,总名义敞口最高 40%。版本 B 将重叠两腿各降至 10%,最高敞口 20%。二者约 62% 交易日空仓。

关键结果

原文结果与口径
核对项结果意味着什么
被删除的股票腿p = 0.068有正收益,但不足以证明优于 VTI 自带漂移的随机 5 日窗口。
叠加组合年收益2.2%—2.8%低名义仓位的独立叠加收益,不等于加入任何底仓后都能原样增加这些收益。
最高名义敞口20% / 40%两个版本仓位口径不同;小回撤必须与小仓位一起阅读。

怎么理解?

最好的对照是被作者否定的那条腿:相同 ETF 的随机窗口比零收益基准更难战胜,也更贴近“择时有没有增量”的问题。月末买债本来就有收益,则股债强弱条件可能只是改变收益大小,不能据此认定所有利润都来自再平衡。 但这里还有一个比显著性更优先的时序检查:若某月不足 20 个交易日,前 15 日的信号窗口与最后 5 日的持有窗口可能重叠。要逐月核对最早下单时刻是否已经知道完整信号;原文没有展示这份账本。其次,机构流量只是解释假说,文章没有直接观测强制再平衡资金,相关性不能把机制坐实。

最大限制

持有长度和交易腿经过样本内筛选,单腿随机检验未消除整个搜索过程的多重比较。随机重采样还应保留时间依赖并处理窗口重叠。收盘市价单仍有成本;用减少底仓替代借券,会改变底仓收益,不能继续套用独立做空的无成本损益。

复现与研究价值

先复核每个月信号截止与成交时刻,再冻结三条规则做后续样本测试;补上月度区块重采样、全搜索族校正和收盘滑点。A 股借鉴的是“标的原生漂移基准”的检验思路,不能默认美国股债月末现金流结构适用于国内市场。

原文与核查

已读网页正文及图注中的统计;未取得逐笔交易账本,未独立回测。

原始文章 ↗

推荐 81/100 · 问题 27/30 · 证据 20/30 · 方法 23/25 · 复现 11/15

随机窗口对照与拆分收益来源有启发;时间窗重叠、样本内挑选和成本口径尚需复核。

返回全年目录 ↑

Quantocracy / Word 标准 · 材料受限,不计完整解析 / 独立研究

深度动量:别只选最可能上涨的股票,还要看所有结果的概率与回报

Uncertainty

Quantitativo;相关论文 Chulwoo Han、Chang Qin

一句话先讲结论

这篇的独立实现报告年化 18.5%、夏普 1.78,而基准夏普为 0.51;但作者明确省略了不少实现细节,不能据此复刻结果。真正值得研究的是排序方法:不只看股票最可能落入哪个收益档,而是把各档概率与对应回报一起计算;“最可能赢家”未必是“期望收益最高的股票”。

它到底在问什么?

一个股票大概率上涨,却有不小概率大跌,分类器仍可能把它判成赢家。只取最高概率那一档,会不会丢掉对投资最重要的下行信息?文章借两篇 Deep Momentum 研究讨论这个问题,再给出自己的实现结果。

作者具体怎么做?

  1. 先根据历史动量等特征预测股票落入不同收益档位的概率,而不是只保留一个最可能标签。国际扩展研究用跨国数据考察这种收益分布特征,SSRN 摘要确认覆盖 45 个国家。
  2. 再把概率转成用于投资排序的分数。关键差别是保留概率分布,而不是用硬分类标签排序;收益档位代表值也只能来自当时可用的训练数据,不能用未来全样本档位均值。
  3. 博主给出自己的策略表现,但公开文没有披露足以重建实现的训练切分、全部工程调整、选股与执行细节。因此下面统计只作为博主报告,不等于本站核验了完整模型或原论文结果。

关键结果

原文结果与口径
核对项结果意味着什么
博主实现夏普1.78 vs 0.51自己的实现与自己的基准;不是国际论文的全球组合结果。
博主实现年化收益18.5%公开文未完整说明模型与成本,不能写作已核验净收益。
博主实现最大回撤−32.8%高夏普并不意味着小回撤;基准为 −56.8%。

怎么理解?

这条思路的核心不是“神经网络比传统动量更聪明”,而是训练目标与交易决策有没有对齐。硬分类准确率关心标签是否猜对,投资收益还关心猜错时损失多大。即使模型和特征完全不变,仅改变概率到持仓的映射,也可能改变策略表现。 但完整概率向量不等于可靠概率。若模型对尾部风险过度自信,用它计算期望回报反而可能放大错误。因此我会把概率校准和排序规则分别检验:分类准确率相同的两个模型,可能具有完全不同的收益校准和尾部损失。也不能从有限回测没有遇到某次崩盘,推断策略消除了动量崩盘风险。

最大限制

原论文完整正文和博主实现尚未核验,本文不转述异常高的全球夏普作为可靠策略结论。论文写作日、SSRN 上传日和本篇博客日期也不同。多国数据必须按日历切分,不能随机拆国家—日期行;交易成本、微盘股、卖空和退市处理均需单独审查。

复现与研究价值

A 股个股可做三路同条件对照:传统动量排序、最大概率标签排序、概率加权收益排序。保持股票池、特征、训练窗、调仓日和成本一致,再看提升来自概率映射还是其他改动;补看校准曲线、换手、分市值结果以及不同市场状态的尾部回报。此处是提案,未执行。

原文与核查

已读博主正文并核对其报告数字;已查 SSRN 摘要与版本信息,尚未取得完整论文逐表核查。

原始文章 ↗

国际研究:原文引用的 SSRN 版本

国际研究:2026 年 7 月版本

早期美国研究:Management Science DOI

推荐 75/100(暂定) · 问题 29/30 · 证据 15/30 · 方法 24/25 · 复现 7/15

问题和方法价值高,但独立实现细节不充分,原论文逐表核查未完成;暂定阅读分,不评价策略可交易性。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 研究博客

缺一个宏观因子就删整行?补缺让回测多出九年,也改变了比较口径

How imputation helps statistical learning for macro trading signals

Rushil Gholkar、Ralph Sueppel、Stefan Swandel / Macrosynergy

一句话先讲结论

用 11 个宏观因子预测 8 种发达市场货币时,丢掉所有不完整观测的版本只能从 2005 年生成信号;放宽因子准入并补缺后,最早可从 1996 年开始,报告夏普也由约 0.4 升至 0.6。但三种版本的回测区间并不相同,所以这首先说明“删整行会浪费大量信息”,还不能把 0.2 的夏普差都解释成补缺带来的 Alpha。

它到底在问什么?

一个国家有十项宏观数据,只因第十一项缺失就把整个月删掉,会不会让模型既学不到东西,又迟迟凑不齐可回测样本?作者研究的是信息保留与人为填值之间的取舍,而不是创造缺失的真实数据。

作者具体怎么做?

  1. 使用 JPMaQS 历史时点宏观信息,构造增长、消费、信心、就业、通胀、实际利率、国际投资头寸和贸易条件等 11 个因子。交易 AUD、CAD、JPY、NZD、CHF、NOK、SEK、GBP 相对各自基准货币的 1 个月远期。
  2. 面板线性模型在普通/时间加权最小二乘、是否非负约束、是否截距之间选择;时间权重半衰期为 5 年。按序扩展可用历史,以面板交叉验证的策略 Sortino 选模型,不是一次性用全样本估计后回填。
  3. 比较不补缺、限制性补缺和积极补缺。限制版要求至少 4 个同期国家才能补一个因子、至少 5 个因子才能出信号;积极版降低国家及因子准入门槛,允许更稀疏的早期数据参与。补缺候选是同组国家均值和中性零值,也进入模型选择。
  4. 月末把预测转成经过标准化和截尾的下月持仓,执行延迟一天。展示的净值统一缩放到年化 10% 波动,但不计交易成本、风险管理或复利。

关键结果

原文结果与口径
核对项结果意味着什么
可生成信号的起点2005 → 1996积极补缺延长约 9 年历史,但早期实际使用的因子比当前少。
报告夏普0.4 → 0.6各自完整可用区间的比较;未计成本,不是共同区间净 Alpha。
限制性补缺 Sortino0.9不补缺为 0.7。收益来源还应结合共同样本与实际填值比例判断。

怎么理解?

这篇有价值的地方,是把缺失值从清洗细节提升为研究设计:一项新增因子可能增加信息,也可能因为历史太短,反而使其他十项因子的训练数据大量消失。只看最终模型有多少因子,看不出这个代价。 但“能回测更早”不等于“同一套策略经历了更多历史”。积极版 1996 年最初只用了 3 个因子,之后才逐渐增加。更长曲线混合了不同信息集,因此应把证据拆为两部分:共同期间是否改善;新增早期样本是否仍与今天要交易的模型有足够相似性。作者报告的早期权重不稳定正好说明这种区分的必要性。

最大限制

数据依赖 JPMaQS 授权;本站未运行所附 notebook。跨国均值会弱化本国特有信息,且回退均值必须只在当期训练集估计。原文图示的不同历史长度不足以单独识别补缺的因果贡献;未计成本净值也不能当可实现收益。

复现与研究价值

迁移 A 股多因子或宏观择时时,先输出三张对照:每期真实观测/填值比例、相同日期与股票池的收益比较、按缺失程度分组的 IC。补缺器必须放进每折训练流程;另外保留“减少因子但不补缺”的基准,以区分信息增量与样本保留效应。

原文与核查

已读正文、参数设定、收益口径和因子附录;未独立执行 notebook 或核验授权数据。

原始文章 ↗

推荐 82/100 · 问题 28/30 · 证据 23/30 · 方法 23/25 · 复现 8/15

把缺失值与历史可用信息联系起来,方法能迁移;不同样本起点和授权数据降低了直接验证便利性。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 研究博客

ChatGPT 做量化:能加快试验,但也会把稳健性检验做成过拟合

One Year Later: Is ChatGPT Finally Worth Using for Quantitative Analysis?

Quantpedia

一句话先讲结论

让 ChatGPT 只用给定 ETF 数据研究 EEM 短期交易,人工改造后的两类候选策略,在原文计入 5 bp 成本的口径下,最佳变体夏普约为 0.524 和 0.483;但模型不断建议加参数、加过滤器,新增美元信号的优势又主要表现为降低波动。文章真正支持的是“LLM 能提高有人监督的研究效率”,不是“LLM 已经能自主找到可靠 Alpha”。

它到底在问什么?

量化研究员把数据、想法筛选和回测交给 ChatGPT,究竟是在节省时间,还是在用更快的速度筛选历史噪声?作者重做一年前的体验测试,关注代码生成、结果整理和研究方向控制。

作者具体怎么做?

  1. 上传 EEM、SPY、IEF、GLD 的价格/净值数据,明确只能用这些数据、只交易 EEM、持仓几天,先让模型提出 10 个思路并汇总初步回测。
  2. 人工选择并改变其中两个思路:一是把风险偏好上升触发器反过来,测试风险规避期间的 EEM 反转;二是把相对一篮子资产的均值回归,简化为 EEM 相对 SPY 的弱势反转。
  3. 第二类最佳变体使用 5 日 EEM−SPY 收益差、20 日 z-score、−1.25 入场阈值和最多 5 日持有。后续又主动去掉标准化窗口等参数,只保留相对收益回看长度和 1—3 日持有期,检查是否依赖狭窄最优点。
  4. 加入美元 ETF UUP,比较原始风险规避信号(SPY 过去 X 日下跌、IEF 同期上涨)与美元替代/附加版本;再更换交易资产为 SPY,并比较不同参数区域的平均净值。作者索取 Python 代码,检查模型报告的执行错位问题。

关键结果

原文结果与口径
核对项结果意味着什么
风险规避后反转候选Sharpe ≈ 0.5243 日风险规避窗口、不额外要求 EEM 下跌;是该组最佳变体,不是平均结果。
EEM 相对 SPY 反转候选Sharpe ≈ 0.483复杂参数版本的最佳结果,不能直接转用于后续简化模型。
新增美元条件的主要优势降低波动更少交易可以同时降低风险和机会,不等于增加预测信息。

怎么理解?

最值得带走的不是这两条 EEM 策略,而是作者对“下一步建议”的警惕:LLM 很擅长继续给出可做的试验,却不天然区分验证原假设与寻找更漂亮的回测。一次次加入看似合理的条件,仍然是在使用同一段历史选模型。 因此,降低参数数量只是第一步;研究员还要事先写下什么结果会否定策略。新增美元条件后,应比较同一时段、同一风险预算下的收益和交易机会,而不是只看波动下降。更换相关资产也有参考价值,但 EEM 与 SPY 的共同市场冲击使它弱于真正独立的样本外检验。

最大限制

正文没有给出足以重建全部实验的固定模型版本、完整机器可读数据及预先冻结的样本外方案;部分统计只在图片中,本解析不补造。代码自查发现一个问题,不代表所有执行时序已无误;作者关于效率提升的判断也不是计时对照实验。

复现与研究价值

适合拿来改造研究流程:把“提想法”和“验证”拆开。先冻结最多两三个核心参数、可用信息时点和否决条件,再让 LLM 批量生成对照;最终用独立实现核验持仓和交易账本。迁移 A 股时先处理涨跌停、停牌与 T+1,不照搬 ETF 的短持有成交假设。

原文与核查

已读原网页正文并核对文内参数与统计;图片中的其他数字未转录,代码未独立执行。

原始文章 ↗

推荐 78/100 · 问题 27/30 · 证据 18/30 · 方法 23/25 · 复现 10/15

研究流程警示实用,给出真实参数和失败方向;但不是受控模型评测,也没有冻结样本外的自主 Alpha 证据。

返回全年目录 ↑

Quantocracy / 导读完成

AI 能加速写回测,但谁来说明这个收益为什么会存在?

More of the Disease, Faster (What happens when you ask an LLM to find you an edge)

Kris Longmore

这是一篇研究流程评论,不是证明大模型无效的实验论文。它提醒我们:写出了验证代码,不等于已经验证了投资逻辑。

2 分钟看懂

一个回测很好看,但你说不清它为什么赚钱,遇到回撤时靠什么决定继续还是停止?

增加过滤器通常能改善旧曲线,却不一定增加对市场的理解。

编辑自设例子,非作者实验

自设例子:假设某种被动调仓带来暂时冲击。可检验的问题应是调仓规模、价格影响及回补速度,而不只是哪个均线窗口最好。机制若消失,模型也应允许宣布假设失败。

  1. 写出可被反驳的机制
  2. 推导应观察到的市场现象
  3. 用未参与设计的数据检验
  4. 失败后更新理解,而非只换参数
关键结果与解释边界
核对项结果意味着什么
文章类型观点评论不是受控模型对比实验。
模型胜率NOT_FOUND未提供,不能凭观点补出一个数字。
统一回测结果NOT_FOUND没有同设置策略表,适合讨论研究纪律而非评估收益。

不能推出什么

作者对 LLM 能力的强判断属于观点。机制叙事也可能事后编造,不能因为故事合理就跳过数据检验。

研究用途

让代理明确写出“什么结果会推翻这个假设”,比要求它给出更自信的投资故事更有用。

详细讲解

编辑理解

一个回测很好看,但你说不清它为什么赚钱,遇到回撤时靠什么决定继续还是停止?

增加过滤器通常能改善旧曲线,却不一定增加对市场的理解。

自设例子:假设某种被动调仓带来暂时冲击。可检验的问题应是调仓规模、价格影响及回补速度,而不只是哪个均线窗口最好。机制若消失,模型也应允许宣布假设失败。

原文证据

原文实际报告了什么

作者认为研究需要经济机制和数据证据,反对让 LLM 不断生成规则、调参、回测,却不理解交易机会为何存在。文章以读者使用代理的经历展开,没有提供可供比较的模型胜率或统一回测实验。

原文位置:正文关于交易对手与 mechanism / evidence 的讨论
编辑理解

为什么值得讨论,哪里不能外推

我不会把“先有经济故事”设为所有有效研究的必要条件:数据驱动发现也可能有价值。但研究者必须知道证据如何变化才会改变判断。一个不能失败的故事和一个被无限调参救回的回测有同样的问题。更合理的分工是人负责限定问题与决策标准,工具负责可追溯执行;二者都要接受反例。

作者对 LLM 能力的强判断属于观点。机制叙事也可能事后编造,不能因为故事合理就跳过数据检验。

核查记录

导读完成:核对网页相关方法、结果与限制段落;未逐图及逐行代码审计,未独立复现

四种日期不混用
收录日来源网页日论文首次公开最新版本日
2026-03-192026-03-19待核 / 不适用待核
网页导读核对记录(不是本站回测)
核对项原文 / 状态解读边界
文章类型观点评论不是受控模型对比实验。
模型胜率NOT_FOUND未提供,不能凭观点补出一个数字。
统一回测结果NOT_FOUND没有同设置策略表,适合讨论研究纪律而非评估收益。

原文位置:正文关于交易对手与 mechanism / evidence 的讨论

推荐 64/100 · 问题 26/30 · 证据 12/30 · 方法 21/25 · 复现 5/15

很适合团队讨论研究纪律,但属于评论而非受控证据;没有可独立复现的主实验,因此证据与复现分低。

尚未执行的实验思路

让代理明确写出“什么结果会推翻这个假设”,比要求它给出更自信的投资故事更有用。

返回全年目录 ↑

Quantocracy / 导读完成

宏观信号不缺复杂模型,缺的是约束模型的理由

Macro trading signals with regression-based machine learning

Rushil Gholkar、Ralph Sueppel

宏观事件稀少,增加模型自由度的代价很高。比较回归方法时,经济约束和样本外选择流程往往比模型名称更重要。

2 分钟看懂

增长、通胀和利率能组合成信号,但回归模型越多,选出来的赢家就越可靠吗?

宏观数据行数很多,不代表独立经济周期很多。复杂模型可能反复学习同一个时期的偶然关系。

编辑自设例子,非作者实验

自设例子:同一轮通胀冲击同时影响许多国家,把每个国家每一天都当独立的新样本,会夸大信息量。模型需要跨市场数据,也需要理解共同冲击。

  1. 构建当时可知的宏观信息
  2. 限定模型候选与方向约束
  3. 历史内选择并重估
  4. 只用于下一期信号
关键结果与解释边界
核对项结果意味着什么
作者 Sharpe 范围低于 0.7 至 1.3各回归方案的模拟结果区间,并非扣费后实盘业绩。
比较风险口径年化波动 10%经过风险缩放后比较,不同原始杠杆不能忽略。
交易成本未计入高换手方法尤其需要另做成本敏感性测试。

不能推出什么

数据有访问门槛,结果没有计入成本;本文长历史是作者实验,不是替用户指定滚动窗口。

研究用途

在当前样本下先固定少量基线,再判断更灵活模型是否给出稳定的增量。

详细讲解

编辑理解

增长、通胀和利率能组合成信号,但回归模型越多,选出来的赢家就越可靠吗?

宏观数据行数很多,不代表独立经济周期很多。复杂模型可能反复学习同一个时期的偶然关系。

自设例子:同一轮通胀冲击同时影响许多国家,把每个国家每一天都当独立的新样本,会夸大信息量。模型需要跨市场数据,也需要理解共同冲击。

原文证据

原文实际报告了什么

作者以逐时点面板学习比较回归信号,三类策略 Sharpe 约从低于 0.7 到 1.3。模拟月末定信号、一天执行、下月再平衡,忽略交易成本与复利,波动缩放至年化 10%。数据复核需要 DataQuery / JPMaQS 访问。

原文位置:Overview of regression methods and PnL results;文章开头数据说明
编辑理解

为什么值得讨论,哪里不能外推

判断模型是否更好,应比较它在同样信息、同样成本假设和同样调参预算下的增量。若一个方法试了几十种变体,另一个只用默认值,最终的排名同时混入了研究投入。宏观信号还应看收益是否集中在少数重大事件;平均绩效漂亮但只靠一次周期,和跨环境持续有效不是一回事。

数据有访问门槛,结果没有计入成本;本文长历史是作者实验,不是替用户指定滚动窗口。

核查记录

导读完成:核对网页相关方法、结果与限制段落;未逐图及逐行代码审计,未独立复现

四种日期不混用
收录日来源网页日论文首次公开最新版本日
2026-03-072026-03-07待核 / 不适用待核
网页导读核对记录(不是本站回测)
核对项原文 / 状态解读边界
作者 Sharpe 范围低于 0.7 至 1.3各回归方案的模拟结果区间,并非扣费后实盘业绩。
比较风险口径年化波动 10%经过风险缩放后比较,不同原始杠杆不能忽略。
交易成本未计入高换手方法尤其需要另做成本敏感性测试。

原文位置:Overview of regression methods and PnL results;文章开头数据说明

推荐 80/100 · 问题 27/30 · 证据 23/30 · 方法 23/25 · 复现 7/15

顺序学习与模型约束讨论实用,成本遗漏与数据访问限制需要扣分;未运行 notebook。

尚未执行的实验思路

在当前样本下先固定少量基线,再判断更灵活模型是否给出稳定的增量。

返回全年目录 ↑

Quantocracy / 导读完成

宏观数据修订不仅会制造假信号,也会把真信号藏起来

Point-in-time economics and financial market forecasting

Fabio Cereda、Ralph Sueppel

市场交易的是当时公开的信息,不是多年以后修订好的历史。用错数据版本,可能高估,也可能低估信号。

2 分钟看懂

今天下载的一列“2010 年 GDP”,真的是 2010 年研究员当时看到的数字吗?

简单把最终值向后平移发布滞后,只修了发布日期,没有修正后来多次改写的数值。

编辑自设例子,非作者实验

自设例子:某月先报告增长放缓,后修订为加速。市场当时下跌未必是没有看懂增长;它可能只是面对了与我们今天回测不同的信息。

  1. 记录数据所属期
  2. 记录真正公开时间
  3. 保留当时版本
  4. 按交易时点拼接信息集
关键结果与解释边界
核对项结果意味着什么
外汇对照样本15 个市场工业增长案例的范围,不是全球所有资产。
修订数据显著性超过 90%作者采用的检验口径,不是预测正确率。
逐时点相关性约减半在该案例中原有关系不再显著,不能泛化为所有宏观因子减半。

不能推出什么

这不是“把信号滞后一个月”就能解决的问题。数据库必须能表达历史版本;完整复核还受数据许可限制。

研究用途

任何宏观回测先验收数据版本与可用时间,再解释策略好坏。

详细讲解

编辑理解

今天下载的一列“2010 年 GDP”,真的是 2010 年研究员当时看到的数字吗?

简单把最终值向后平移发布滞后,只修了发布日期,没有修正后来多次改写的数值。

自设例子:某月先报告增长放缓,后修订为加速。市场当时下跌未必是没有看懂增长;它可能只是面对了与我们今天回测不同的信息。

原文证据

原文实际报告了什么

作者比较历史信息状态与修订数据。工业增长预测外汇的 15 个新兴市场样本中,修订数据通过 90% 显著性口径,逐时点数据的相关性约减半且不显著。另讨论进口与信贷指标,说明修订误差会累积。

原文位置:Examples of hindsight errors:Overestimating the quality of short-term industry growth
编辑理解

为什么值得讨论,哪里不能外推

对数据工程最有用的是把一个“日期”拆成不同字段。观测所属期、首次发布日期、修订发布日期、我们实际获得的时间,回答四个不同问题。漏掉其中一个,简单的数据库 join 就可能把未来版本接回过去。我的验收会抽查极端修订月份,逐条重放当时的信息集,而不是只看回测代码有没有 shift。

这不是“把信号滞后一个月”就能解决的问题。数据库必须能表达历史版本;完整复核还受数据许可限制。

核查记录

导读完成:核对网页相关方法、结果与限制段落;未逐图及逐行代码审计,未独立复现

四种日期不混用
收录日来源网页日论文首次公开最新版本日
2026-02-132026-02-07待核 / 不适用待核
网页导读核对记录(不是本站回测)
核对项原文 / 状态解读边界
外汇对照样本15 个市场工业增长案例的范围,不是全球所有资产。
修订数据显著性超过 90%作者采用的检验口径,不是预测正确率。
逐时点相关性约减半在该案例中原有关系不再显著,不能泛化为所有宏观因子减半。

原文位置:Examples of hindsight errors:Overestimating the quality of short-term industry growth

推荐 84/100 · 问题 29/30 · 证据 24/30 · 方法 24/25 · 复现 7/15

直接展示修订数据与实时信息差异,方法价值高;商业数据访问和未独立运行限制复现分。

尚未执行的实验思路

任何宏观回测先验收数据版本与可用时间,再解释策略好坏。

返回全年目录 ↑

Quantocracy / 待获取全文

系统平均很快,却在最需要交易时读到了旧行情

Data: Data structures as lifecycle engineering

Quant Beckman

低延迟工程首先要保证读到的是同一个有效市场状态。可见部分的问题诊断有价值,但示例代码不是生产级保证,后半文仍受付费墙限制。

2 分钟看懂

平均处理一条行情只需很短时间,为什么实盘仍会交易到不存在的价差?

平均耗时没有反映信息年龄,也没有保证买价与卖价来自同一次更新。模型输入如果混合了两个状态,再精确的计算也可能是在计算一个从未出现过的市场。

编辑自设例子,非作者实验

编辑自设:盘口先为 100/101,随后为 102/103;读线程若混读成买价 102、卖价 101,就会看到虚假的倒挂。正确目标不是把计算再快一点,而是让策略拒绝使用混合快照。

  1. 标记行情序列和数据年龄
  2. 给队列设容量与溢出处理
  3. 验证快照来自一致更新
  4. 发生缺口后停用依赖连续状态的计算
关键结果与解释边界
核对项结果意味着什么
已读范围公开部分至 Point 4Point 5 起及附录未读,不算全文完成。
分位数示例update 为 pass正文是骨架,不能复制后就声称监控已实现。
延迟目标尾部与数据年龄不是只看平均循环耗时。

不能推出什么

没有执行代码,也没有可核对的端到端基准。后半文付费受限;公开 P² 估计器只是占位实现,不能当成已验证高频基础设施。

研究用途

可以把数据年龄、序号缺口与一致性检查列入工程检查表;不可将文中代码片段直接当生产实现。

详细讲解

编辑理解

平均处理一条行情只需很短时间,为什么实盘仍会交易到不存在的价差?

平均耗时没有反映信息年龄,也没有保证买价与卖价来自同一次更新。模型输入如果混合了两个状态,再精确的计算也可能是在计算一个从未出现过的市场。

编辑自设:盘口先为 100/101,随后为 102/103;读线程若混读成买价 102、卖价 101,就会看到虚假的倒挂。正确目标不是把计算再快一点,而是让策略拒绝使用混合快照。

原文证据

原文实际报告了什么

公开段落讨论行情突发时的队列积压、尾部延迟、读写一致性和数据布局校验,展示固定容量队列、分位数估计器骨架及快照读取片段。页面在 Deterministic replay 一节开始处出现付费墙,后续恢复机制与附录未取得。

原文位置:公开 Introduction 至 Point 4;Point 2 的 update 函数;Point 5 付费墙
编辑理解

为什么值得讨论,哪里不能外推

独立代码审阅意见:文章称某些 Python 片段“零分配”或用一致性协议保证安全,这些说法不能仅靠片段注释成立;实际实现还依赖运行时、内存模型与线程/进程同步。尤其要区分丢弃完整快照和丢弃增量盘口消息,后者可能让整本订单簿失真。覆盖掉旧消息之前,必须知道自己丢掉的是可替代状态还是不可缺失的状态变化。

没有执行代码,也没有可核对的端到端基准。后半文付费受限;公开 P² 估计器只是占位实现,不能当成已验证高频基础设施。

核查记录

有限材料导读:公开正文读至 Point 4;Point 5 起及付费附录未取得。代码片段仅静态阅读,未执行。

四种日期不混用
收录日来源网页日论文首次公开最新版本日
2026-01-272026-01-27待核 / 不适用待核
网页导读核对记录(不是本站回测)
核对项原文 / 状态解读边界
已读范围公开部分至 Point 4Point 5 起及附录未读,不算全文完成。
分位数示例update 为 pass正文是骨架,不能复制后就声称监控已实现。
延迟目标尾部与数据年龄不是只看平均循环耗时。

原文位置:公开 Introduction 至 Point 4;Point 2 的 update 函数;Point 5 付费墙

推荐 61/100 · 问题 27/30 · 证据 10/30 · 方法 19/25 · 复现 5/15

切中实盘输入失真;部分示例未实现、性能保证未验证且全文受限,评分仅针对公开部分。

尚未执行的实验思路

可以把数据年龄、序号缺口与一致性检查列入工程检查表;不可将文中代码片段直接当生产实现。

返回全年目录 ↑

Quantocracy / 导读完成

大家都在卖的时候谁接盘?日内与隔夜的答案可能不同

Who Is the Counterparty to the Pro-Cyclical Investors

Johannes Beutel、Maik Schmeling、Willy Scherrieble;Quantpedia 导读

不要把长期机构自然想成逆向买家。导读中的逐笔交易研究显示,吸收资管净流量的关键角色是交易商银行,而且结论取决于观察频率。

2 分钟看懂

一个群体集中卖出时,为什么不能只靠“每笔交易都有买家”解释市场会不会失去流动性?

成交恒等式只保证买卖数量相等,不保证买家愿意以原价接单。研究要问的是谁承担库存、承担多久,以及当这个群体收缩风险预算时,价格要让步多少。

编辑自设例子,非作者实验

编辑自设:高频交易者上午买入、下午卖回,日内看像重要接盘者,日终净持仓却接近零。交易商若把库存留到次日,日频数据会显示它承担更多净风险。这两个观察并不矛盾,不能拿日内成交额推断隔夜风险吸收。

  1. 识别逐笔交易双方的部门
  2. 按统一频率聚合净买卖
  3. 比较与资管净流量的同向或反向关系
  4. 区分短时中转与持续库存吸收
关键结果与解释边界
核对项结果意味着什么
观察频率15 分钟至 1 个月改变频率会改变谁像流动性提供者。
日频量级PTF 约 10% / 对冲约 5%相对于资管净流量的吸收估计,不是成交量市场份额。
长期投资者并非天然逆向本研究样本中的部门行为,不能外推到每家机构。

不能推出什么

本条核对的是导读和引用片段,未审底层交易数据库、部门分类误差及完整回归。欧洲市场结构不能直接套入 A 股。

研究用途

在流动性研究中明确时间尺度和谁承担库存,避免将交易量、净流量与承接能力混为一谈。

详细讲解

编辑理解

一个群体集中卖出时,为什么不能只靠“每笔交易都有买家”解释市场会不会失去流动性?

成交恒等式只保证买卖数量相等,不保证买家愿意以原价接单。研究要问的是谁承担库存、承担多久,以及当这个群体收缩风险预算时,价格要让步多少。

编辑自设:高频交易者上午买入、下午卖回,日内看像重要接盘者,日终净持仓却接近零。交易商若把库存留到次日,日频数据会显示它承担更多净风险。这两个观察并不矛盾,不能拿日内成交额推断隔夜风险吸收。

原文证据

原文实际报告了什么

研究按投资者部门分组欧洲股票和利率市场交易,在 15 分钟至一个月频率考察资管净流量的对应方。导读报告日频下交易商银行占主导,自营交易公司和对冲基金吸收比例约 10% 和 5%;长期投资者反而表现为同向交易。

原文位置:Quantpedia 开篇;所引 Figures 1–3;频率与投资者部门结果段
编辑理解

为什么值得讨论,哪里不能外推

研究员能带走的是流动性压力分析的结构,而不是某个买卖点。我的建议是把成交活跃度与承接能力分开:很多账户互相倒手能形成大成交,却不一定有人愿意持有新增风险。部门回归的比例也不宜做成简单饼图,因为还有同向放大流量、不同市场以及估计误差,不一定按你选取的几项恰好加到 100%。

本条核对的是导读和引用片段,未审底层交易数据库、部门分类误差及完整回归。欧洲市场结构不能直接套入 A 股。

核查记录

已核 Quantpedia 网页及研究引用;未取得底层论文全表和逐笔交易数据。

四种日期不混用
收录日来源网页日论文首次公开最新版本日
2026-01-272026-01-26待核 / 不适用待核
网页导读核对记录(不是本站回测)
核对项原文 / 状态解读边界
观察频率15 分钟至 1 个月改变频率会改变谁像流动性提供者。
日频量级PTF 约 10% / 对冲约 5%相对于资管净流量的吸收估计,不是成交量市场份额。
长期投资者并非天然逆向本研究样本中的部门行为,不能外推到每家机构。

原文位置:Quantpedia 开篇;所引 Figures 1–3;频率与投资者部门结果段

推荐 71/100 · 问题 28/30 · 证据 17/30 · 方法 22/25 · 复现 4/15

交易对手识别与频率区分很有价值;当前导读层证据,监管级逐笔身份数据难以复现。

尚未执行的实验思路

在流动性研究中明确时间尺度和谁承担库存,避免将交易量、净流量与承接能力混为一谈。

返回全年目录 ↑

Quantocracy / 导读完成

比特币最优权重为负?关键在预期收益假设,不是优化器投票看空

Is The Optimal Long-term Portfolio Share of Bitcoin Negative?

Alistair Milne;Quantpedia 导读

负权重是特定收益假设与协方差输入的条件结果。它提醒我们审查优化器的输入,不能据此推断比特币未来一定下跌。

2 分钟看懂

为什么相同的历史涨幅,在不同资产配置研究里会导出正负相反的 BTC 权重?

均值方差优化器不判断资产的投资叙事。它接受预期收益、波动、协方差和约束,再计算组合。如果不同研究先给 BTC 填入不同的长期收益,权重方向不同并不奇怪。

编辑自设例子,非作者实验

编辑自设:一种资产与股票同涨同跌、波动很大,预期超额收益又设为零,它在最优组合中很难因“曾经大涨”获配。若提高它的预期收益,答案可能改变。这不是证明任何一个预期正确,而是说明权重本身不能反过来验证输入。

  1. 分开历史实现收益与未来收益假设
  2. 估计与股票的协方差
  3. 明确允许做空还是只做多
  4. 检验最优权重对假设的敏感性
关键结果与解释边界
核对项结果意味着什么
全样本风险估计-1.6%作者设定下风险组合中的 BTC 比例,不是所有投资者总资产比例。
较近风险估计-7.3%协方差改变可显著改变结果。
关键输入长期预期收益假设不是只凭历史协方差就能决定符号。

不能推出什么

本条只核对导读,底层论文假设推导未完整审计。没有把厚尾、动态配置和现实做空摩擦都纳入一个可直接执行的结论。

研究用途

阅读任何“最优配置”论文时,先找预期收益这一行;用假设敏感性解释权重,而不是直接抄小数点后的比例。

详细讲解

编辑理解

为什么相同的历史涨幅,在不同资产配置研究里会导出正负相反的 BTC 权重?

均值方差优化器不判断资产的投资叙事。它接受预期收益、波动、协方差和约束,再计算组合。如果不同研究先给 BTC 填入不同的长期收益,权重方向不同并不奇怪。

编辑自设:一种资产与股票同涨同跌、波动很大,预期超额收益又设为零,它在最优组合中很难因“曾经大涨”获配。若提高它的预期收益,答案可能改变。这不是证明任何一个预期正确,而是说明权重本身不能反过来验证输入。

原文证据

原文实际报告了什么

导读介绍 Milne 的均值方差研究:在股票与 BTC 的风险资产组合中,用 2014–2025 风险估计得到 BTC 权重 -1.6%,用较近样本为 -7.3%。长期预期收益不是简单沿用 BTC 的历史涨幅,而依赖作者的资产定价假设。

原文位置:Quantpedia 摘要与 Figure 2 引述;SSRN 5176989 原地址
编辑理解

为什么值得讨论,哪里不能外推

我的判断是,真正值得讨论的不是 -1.6% 是否精确,而是资产的边际预期回报够不够补偿它给现有组合增加的风险。做多约束、融资和做空成本都会改变可实施答案。风险厌恶程度影响总体风险仓位;风险资产内部的相对比例与总资产仓位也不能混淆。

本条只核对导读,底层论文假设推导未完整审计。没有把厚尾、动态配置和现实做空摩擦都纳入一个可直接执行的结论。

核查记录

导读完成:核对 Quantpedia;底层 SSRN 全文和参数推导未完整审计。

四种日期不混用
收录日来源网页日论文首次公开最新版本日
2026-01-252026-01-22待核 / 不适用待核
网页导读核对记录(不是本站回测)
核对项原文 / 状态解读边界
全样本风险估计-1.6%作者设定下风险组合中的 BTC 比例,不是所有投资者总资产比例。
较近风险估计-7.3%协方差改变可显著改变结果。
关键输入长期预期收益假设不是只凭历史协方差就能决定符号。

原文位置:Quantpedia 摘要与 Figure 2 引述;SSRN 5176989 原地址

推荐 66/100 · 问题 26/30 · 证据 14/30 · 方法 20/25 · 复现 6/15

有助于理解配置结论的条件性;当前只有导读层核验,关键预期与实现假设仍待审计。

尚未执行的实验思路

阅读任何“最优配置”论文时,先找预期收益这一行;用假设敏感性解释权重,而不是直接抄小数点后的比例。

返回全年目录 ↑

Quantocracy / 导读完成

AI 越一致,市场就越脆弱?这是可检验的假说,不是已证实的规律

The Age of AI Attractor Markets: One Possible Trajectory

Tommi Johnsen、Svetlana Shasharina

多套模型可能因为同样的数据和约束而同时退出。文章的用途是提出压力测试问题,而不是预测下一次崩盘。

2 分钟看懂

十套看起来不同的 AI 策略,是否真的提供了十份独立风险?

算法名称不同不等于交易行为不同。若都使用相同信息、相同风险上限,在波动升高时都要卖出,平常不高的收益相关性也可能掩盖压力下的共同动作。

编辑自设例子,非作者实验

编辑自设:三套选股模型持仓不同,却都把组合波动控制在同一个水平。市场突然跳跌后,三个模型可能同时减仓。此时交易同步来自风控约束,不一定来自 LLM 权重。仅观察同步卖出,无法辨别这两种原因。

  1. 把共同数据与共同约束分开
  2. 观察压力下订单而非只看平常收益
  3. 加入非 AI 策略对照
  4. 寻找能够否定拥挤假说的证据
关键结果与解释边界
核对项结果意味着什么
证据性质情景推演没有识别 AI 普及的因果效应。
关键观测压力下行为相关性不只计算全样本收益相关。
反例条件AI 增加而同步性不增控制共同市场冲击后,才更接近检验假说。

不能推出什么

没有给出可交易的拐点、阈值或成本后对冲结果。担心尾部风险也不能直接推出长期买期权必然合算。

研究用途

做模型组合评审时同时列出信息来源、风险约束和压力下减仓规则,避免仅凭模型名称认定分散化。

详细讲解

编辑理解

十套看起来不同的 AI 策略,是否真的提供了十份独立风险?

算法名称不同不等于交易行为不同。若都使用相同信息、相同风险上限,在波动升高时都要卖出,平常不高的收益相关性也可能掩盖压力下的共同动作。

编辑自设:三套选股模型持仓不同,却都把组合波动控制在同一个水平。市场突然跳跌后,三个模型可能同时减仓。此时交易同步来自风控约束,不一定来自 LLM 权重。仅观察同步卖出,无法辨别这两种原因。

原文证据

原文实际报告了什么

作者明确把文章定位为一种推测情景:相似的数据表示、目标与反馈可能使行为收敛,平时看似稳定,遇到共同无法处理的冲击时同步失效。文末列出反驳条件,例如 AI 使用增加但控制宏观因素后的策略相关性不升反降。

原文位置:开篇情景声明;Counterarguments and boundary conditions;What would falsify this?
编辑理解

为什么值得讨论,哪里不能外推

我认为“AI 吸引子”作为比喻容易读起来宏大,却也容易无法证伪。把它转成研究问题,需要明确采用率、订单同步性与流动性指标,找到合适对照,并排除共有风险因子的影响。另一个反方向同样合理:AI 降低研发成本,也可能增加细分策略的多样性。应该让数据区分两条路径,而不是把所有市场现象都解释成收敛。

没有给出可交易的拐点、阈值或成本后对冲结果。担心尾部风险也不能直接推出长期买期权必然合算。

核查记录

导读完成:核对网页相关方法、结果与限制段落;未逐图及逐行代码审计,未独立复现

四种日期不混用
收录日来源网页日论文首次公开最新版本日
2026-01-252026-01-24待核 / 不适用待核
网页导读核对记录(不是本站回测)
核对项原文 / 状态解读边界
证据性质情景推演没有识别 AI 普及的因果效应。
关键观测压力下行为相关性不只计算全样本收益相关。
反例条件AI 增加而同步性不增控制共同市场冲击后,才更接近检验假说。

原文位置:开篇情景声明;Counterarguments and boundary conditions;What would falsify this?

推荐 55/100 · 问题 25/30 · 证据 8/30 · 方法 18/25 · 复现 4/15

压力测试思路有启发且列出证伪条件;没有实证识别、执行规则或收益验证。

尚未执行的实验思路

做模型组合评审时同时列出信息来源、风险约束和压力下减仓规则,避免仅凭模型名称认定分散化。

返回全年目录 ↑

Quantocracy / 导读完成

宏观如何落到个股:先学不同公司的敏感度,而不是预测整个指数

Stock selection with macro factors: the case for simple neural networks

Eric Brine、Rushil Gholkar、Ralph Sueppel

同一轮经济变化对公司影响不同。这篇用一个小网络做个股相对信号,但小股票池和幸存者筛选限制了结论。

2 分钟看懂

利率上升对银行、地产和消费公司影响不同,能不能把宏观判断转成个股之间的排序?

对所有股票统一加一个宏观择时仓位,无法利用公司敏感度的差异;逐只回归又可能浪费共同信息。

编辑自设例子,非作者实验

自设例子:如果两家公司面对同一轮利率变化,甲的融资成本上升、乙的利息收入改善,那么“买哪个”可能比“整个市场涨不涨”更值得建模。具体方向仍须由信息和数据共同验证。

  1. 准备逐时点宏观因子
  2. 小网络共享学习公司敏感度
  3. 历史内验证并控制训练
  4. 产生下一期个股相对信号
关键结果与解释边界
核对项结果意味着什么
网络输入 / 股票28 / 22有限因子与小股票池的实验,不是全市场测试。
季度方向准确率约 51%弱信号也值得研究,但不是高命中率选股器。
相对策略 Sharpe0.4—0.6作者未计成本的结果,不是净收益保证。

不能推出什么

长期连续交易与当前市值筛样,不能代表一个真正逐时点变化的全股票池。

研究用途

若迁移到 A 股,首先重建动态股票池与信息时点,再讨论网络结构。

详细讲解

编辑理解

利率上升对银行、地产和消费公司影响不同,能不能把宏观判断转成个股之间的排序?

对所有股票统一加一个宏观择时仓位,无法利用公司敏感度的差异;逐只回归又可能浪费共同信息。

自设例子:如果两家公司面对同一轮利率变化,甲的融资成本上升、乙的利息收入改善,那么“买哪个”可能比“整个市场涨不涨”更值得建模。具体方向仍须由信息和数据共同验证。

原文证据

原文实际报告了什么

作者用 28 个宏观因子、32 个隐藏单元,为 22 只美股同时生成信号。季度方向准确率约 51%,相对价值策略 Sharpe 0.4—0.6,未计交易成本。股票需自 1992 年持续交易,且按当前市值筛选,需注意幸存者与事后选样。

原文位置:A recap of macro factors and stock selection;Sequential signal generation;Predictive power and value generation
编辑理解

为什么值得讨论,哪里不能外推

对量化研究员而言,这篇最好的切入点不是增加网络层数,而是检验共享学习是否优于简单基线。可先比较行业暴露模型、线性个股敏感度和小网络;三者使用同一股票池和相同交易时点。只有当非线性模型在未参与选择的阶段贡献增量,才有理由支付额外复杂度。

长期连续交易与当前市值筛样,不能代表一个真正逐时点变化的全股票池。

核查记录

导读完成:核对网页相关方法、结果与限制段落;未逐图及逐行代码审计,未独立复现

四种日期不混用
收录日来源网页日论文首次公开最新版本日
2026-01-252026-01-24待核 / 不适用待核
网页导读核对记录(不是本站回测)
核对项原文 / 状态解读边界
网络输入 / 股票28 / 22有限因子与小股票池的实验,不是全市场测试。
季度方向准确率约 51%弱信号也值得研究,但不是高命中率选股器。
相对策略 Sharpe0.4—0.6作者未计成本的结果,不是净收益保证。

原文位置:A recap of macro factors and stock selection;Sequential signal generation;Predictive power and value generation

推荐 77/100 · 问题 27/30 · 证据 20/30 · 方法 23/25 · 复现 7/15

从宏观到个股的建模启发明确;22 只股票与事后筛样、未计成本削弱外推证据,商业数据限制复现。

尚未执行的实验思路

若迁移到 A 股,首先重建动态股票池与信息时点,再讨论网络结构。

返回全年目录 ↑

Quantocracy / 导读完成

价值投资失灵了吗?先分清估值贵、公司好与股价还能涨

Is Value Investing Dead?

Jose Ordonez;访谈对象 Tobias Carlisle

这篇为价值投资辩护,但没有给出价值风格何时反转的可检验时点。适合校正概念,不应直接转成加仓信号。

2 分钟看懂

一家公司的业务持续增长,为什么买入其股票仍可能赚不到钱?

股票价格已经包含了市场对增长的预期。财务增长快只说明公司做得好;要取得超额收益,还要比买入价格隐含的预期更好。价值风格讨论的是价格相对基本面的关系,不是简单购买差公司。

编辑自设例子,非作者实验

编辑自设:一家公司利润从 10 增长到 15,但估值从 40 倍降到 20 倍。忽略分红,市值从 400 降到 300,利润增长 50%,投资者却亏 25%。这只是算术示例,不是原文个股案例。

  1. 把基本面增长和估值变动拆开
  2. 检验价值组合是否混入小盘暴露
  3. 区分长期解释与短期入场条件
关键结果与解释边界
核对项结果意味着什么
文章性质访谈观点不能当作新发表的价值因子实证。
核心区分好公司 ≠ 好买价是分析框架,不是反转预测。
交易阈值NOT_FOUND没有由本文验证的估值差买入阈值或持有期限。

不能推出什么

历史类比没有识别技术革命的独立因果作用。估值便宜可能持续很久,本文没有证明一个可以交易的反转时钟。

研究用途

把现有价值策略的收益分成市场、规模、行业、盈利质量与估值暴露贡献;优先解释组合究竟押了什么。

详细讲解

编辑理解

一家公司的业务持续增长,为什么买入其股票仍可能赚不到钱?

股票价格已经包含了市场对增长的预期。财务增长快只说明公司做得好;要取得超额收益,还要比买入价格隐含的预期更好。价值风格讨论的是价格相对基本面的关系,不是简单购买差公司。

编辑自设:一家公司利润从 10 增长到 15,但估值从 40 倍降到 20 倍。忽略分红,市值从 400 降到 300,利润增长 50%,投资者却亏 25%。这只是算术示例,不是原文个股案例。

原文证据

原文实际报告了什么

文章整理 Carlisle 的观点:价值表现受估值差、大小盘环境及技术革命影响;企业经营成功与股票投资回报并非同一件事。它以估值变化和历史案例支持讨论,不是新增一项有完整交易规则的回测。

原文位置:正文关于估值差、技术革命与企业成功/投资回报的三个讨论段
编辑理解

为什么值得讨论,哪里不能外推

对量化研究最有用的追问是:价值因子的弱势究竟来自价值本身,还是同时持有了小盘、低盈利或行业偏离?我的建议是先看暴露分解,再讨论“时代变了”。另一个容易忽略的问题是估值均值可能改变:盈利质量、无形资产计量和行业构成都可能影响历史可比性,不能只看到价差大就断言一定收敛。

历史类比没有识别技术革命的独立因果作用。估值便宜可能持续很久,本文没有证明一个可以交易的反转时钟。

核查记录

导读完成:核对网页相关方法、结果与限制段落;未逐图及逐行代码审计,未独立复现

四种日期不混用
收录日来源网页日论文首次公开最新版本日
2026-01-252026-01-23待核 / 不适用待核
网页导读核对记录(不是本站回测)
核对项原文 / 状态解读边界
文章性质访谈观点不能当作新发表的价值因子实证。
核心区分好公司 ≠ 好买价是分析框架,不是反转预测。
交易阈值NOT_FOUND没有由本文验证的估值差买入阈值或持有期限。

原文位置:正文关于估值差、技术革命与企业成功/投资回报的三个讨论段

推荐 63/100 · 问题 24/30 · 证据 13/30 · 方法 20/25 · 复现 6/15

概念澄清有价值;访谈证据有限,没有新样本外检验或完整实现规则。

尚未执行的实验思路

把现有价值策略的收益分成市场、规模、行业、盈利质量与估值暴露贡献;优先解释组合究竟押了什么。

返回全年目录 ↑

Quantocracy / 导读完成

黄金上涨还不够:为什么再看一眼美债动量?

Gold Cross-Asset Momentum

Allocate Smartly

额外的美债条件会删掉一部分黄金多头月份。重点不是规则更复杂,而是这些被删掉的月份是否真的不值得持有。

2 分钟看懂

黄金本身已经在上涨,再增加美债上涨条件,究竟增加了什么信息?

单资产规则只问黄金有没有趋势;双资产规则还问这个趋势是否处于与债券上涨相容的环境。但债券总收益不是实际利率本身,不能把一个便于计算的价格变量当成宏观原因的直接测量。

编辑自设例子,非作者实验

编辑自设:月末黄金过去一年涨 8%,美债跌 2%。只看黄金的规则下月继续持有,双信号规则转为现金。如果后来黄金继续涨,过滤器就丢掉收益;如果黄金回撤,过滤器才发挥保护作用。每多一道条件,都同时增加避错与错过的机会。

  1. 月末计算两项 12 个月总收益
  2. 两项均严格为正才配置黄金
  3. 否则持有现金
  4. 单独检验被排除月份的机会成本
关键结果与解释边界
核对项结果意味着什么
信号窗口12 个月每月更新,不是每 12 个月才调仓。
额外剔除77 / 405 个月约 19%;分母是黄金单信号允许持有的月份。
较近时期优势减弱长期统计不能直接代表最近环境。

不能推出什么

长期历史使用 ETF 出现前的替代数据。网站称结果扣除交易成本,但本站未逐笔复核其实现;月末信号与成交同一时点的可执行性也须另验。

研究用途

先与原研究对照规则和现金口径;若开展后续复现,将黄金单信号、双信号和等平均风险基准并列,不只比较买入持有。

详细讲解

编辑理解

黄金本身已经在上涨,再增加美债上涨条件,究竟增加了什么信息?

单资产规则只问黄金有没有趋势;双资产规则还问这个趋势是否处于与债券上涨相容的环境。但债券总收益不是实际利率本身,不能把一个便于计算的价格变量当成宏观原因的直接测量。

编辑自设:月末黄金过去一年涨 8%,美债跌 2%。只看黄金的规则下月继续持有,双信号规则转为现金。如果后来黄金继续涨,过滤器就丢掉收益;如果黄金回撤,过滤器才发挥保护作用。每多一道条件,都同时增加避错与错过的机会。

原文证据

原文实际报告了什么

Allocate Smartly 复核 Quantpedia 的黄金跨资产动量:月末观察 GLD 与 IEF 的过去 12 个月总收益,两者都大于零才持有 GLD,否则持有现金。文中称美债条件剔除了黄金自身动量为正时的 405 个月中的 77 个月,长期比较的优势在较近时期减弱。

原文位置:Trading rules;黄金单信号对照;2002 年前后讨论
编辑理解

为什么值得讨论,哪里不能外推

我的阅读重点是三个不同收益口径:持有黄金月份的收益、包含现金月份的组合收益,以及相同平均黄金风险暴露的对照。只看第一项,很容易夸大选时效果。现金收益较高时,空仓策略可能仅靠现金利息改善表现。对组合已有黄金配置的团队,真正的问题是替换后能否增加整体分散化,而非这条曲线单独是否漂亮。

长期历史使用 ETF 出现前的替代数据。网站称结果扣除交易成本,但本站未逐笔复核其实现;月末信号与成交同一时点的可执行性也须另验。

核查记录

导读完成:核对网页相关方法、结果与限制段落;未逐图及逐行代码审计,未独立复现

四种日期不混用
收录日来源网页日论文首次公开最新版本日
2026-01-202026-01-20待核 / 不适用待核
网页导读核对记录(不是本站回测)
核对项原文 / 状态解读边界
信号窗口12 个月每月更新,不是每 12 个月才调仓。
额外剔除77 / 405 个月约 19%;分母是黄金单信号允许持有的月份。
较近时期优势减弱长期统计不能直接代表最近环境。

原文位置:Trading rules;黄金单信号对照;2002 年前后讨论

推荐 81/100 · 问题 25/30 · 证据 22/30 · 方法 22/25 · 复现 12/15

规则清楚且讨论效果衰减;历史数据和成本尚未独立核对,不能据此确认实盘优势。

尚未执行的实验思路

先与原研究对照规则和现金口径;若开展后续复现,将黄金单信号、双信号和等平均风险基准并列,不只比较买入持有。

返回全年目录 ↑

Quantocracy / 导读完成

组合年化从 19.1% 到 23.1%:增益来自优化,还是先找到了互补策略?

Portfolio Optimization

Quantitativo

本文优化的是美、加、澳三个策略的权重,不是让模型直接挑个股。分散化已经贡献了大部分改善,优化带来的 Sharpe 增量相对有限。

2 分钟看懂

手里已经有三个赚钱方式相近、但收益相关性不高的策略,要平均分资金还是估计最优权重?

等权只要求相信三种策略都有长期价值;均值方差优化还要求历史收益、波动与相关性能预测下一年的相对表现。它不是免费升级,而是加入估计误差。

编辑自设例子,非作者实验

编辑自设:甲乙预期收益都为 10%,但过去一段时间甲偶然多赚了 3%。优化器若把这当永久优势,就可能把甲加到上限。权重看似精确,依据却可能只是噪声。0–60% 的约束作用是防止估计误差把资金推到单一策略。

  1. 各市场分别运行股票均值回归策略
  2. 取得三条策略日收益
  3. 年末用过去四年估计参数
  4. 在权重约束内优化并持有下一年
  5. 对照同样年度再平衡的等权组合
关键结果与解释边界
核对项结果意味着什么
CAGR19.1% → 23.1%作者的策略组合比较,不是本站个股回测。
Sharpe1.66 → 1.76收益提升同时伴随波动变化,风险调整改善仅 0.10。
最大回撤-21.4% → -20.7%回撤改善很小,不能概括为全面降风险。

不能推出什么

2010 起点和三个市场/策略的选择都有研究自由度。本文引言提到的生成式模型论文不是后续这个均值方差实验;成本及完整股票池时点信息仍需核对。

研究用途

后续研究先比较等权、等风险和受约束均值方差;保存每年的事前权重及估计误差,不将多个策略的结果误写成个股优化效果。

详细讲解

编辑理解

手里已经有三个赚钱方式相近、但收益相关性不高的策略,要平均分资金还是估计最优权重?

等权只要求相信三种策略都有长期价值;均值方差优化还要求历史收益、波动与相关性能预测下一年的相对表现。它不是免费升级,而是加入估计误差。

编辑自设:甲乙预期收益都为 10%,但过去一段时间甲偶然多赚了 3%。优化器若把这当永久优势,就可能把甲加到上限。权重看似精确,依据却可能只是噪声。0–60% 的约束作用是防止估计误差把资金推到单一策略。

原文证据

原文实际报告了什么

作者对三个市场的股票均值回归策略做组合。2010–2026 的等权组合报告 CAGR 19.1%、Sharpe 1.66、最大回撤 -21.4%;每年用此前四年日收益估计均值方差、单策略权重限制为 0–60% 的版本,分别为 23.1%、1.76、-20.7%。

原文位置:The portfolio;Mean-variance optimization;两组组合绩效图和比较段落
编辑理解

为什么值得讨论,哪里不能外推

这篇最值得学的是先找低相关收益来源,再谈权重。我的理解是,研究员常把精力放在最后一层优化器,却没有问输入的策略是否足够不同。还要警惕收益均值的误差通常比协方差更难处理:如果稍微移动起始日期,最优权重就剧烈变化,漂亮的历史组合未必可持有。作者采用四年估计窗只是本文设定,不是本站建议的通用参数。

2010 起点和三个市场/策略的选择都有研究自由度。本文引言提到的生成式模型论文不是后续这个均值方差实验;成本及完整股票池时点信息仍需核对。

核查记录

导读完成:核对网页相关方法、结果与限制段落;未逐图及逐行代码审计,未独立复现

四种日期不混用
收录日来源网页日论文首次公开最新版本日
2026-01-202026-01-20待核 / 不适用待核
网页导读核对记录(不是本站回测)
核对项原文 / 状态解读边界
CAGR19.1% → 23.1%作者的策略组合比较,不是本站个股回测。
Sharpe1.66 → 1.76收益提升同时伴随波动变化,风险调整改善仅 0.10。
最大回撤-21.4% → -20.7%回撤改善很小,不能概括为全面降风险。

原文位置:The portfolio;Mean-variance optimization;两组组合绩效图和比较段落

推荐 80/100 · 问题 27/30 · 证据 20/30 · 方法 22/25 · 复现 11/15

有清楚对照和实施约束;选样、成本及数据时点未完整独立验证,优化增量需稳健性检验。

尚未执行的实验思路

后续研究先比较等权、等风险和受约束均值方差;保存每年的事前权重及估计误差,不将多个策略的结果误写成个股优化效果。

返回全年目录 ↑

Quantocracy / 导读完成

LLM 把新闻读快了,但更快读懂不等于净收益更高

AI is no longer an experimental “tool” in finance

Tommi Johnsen、Svetlana Shasharina

文章适合建立 AI 文本研究的地图,不适合用来背书一个高收益策略。信息处理、预测能力与可成交利润是三个不同环节。

2 分钟看懂

如果所有团队都能低成本读完新闻,优势会留在模型里,还是转移到别处?

从文章到收益至少经过:拿到数据、辨别信息增量、形成预测、成交、承担风险。模型改进只作用于其中一部分。准确抽取公开消息,也可能在价格已经反映消息后才完成。

编辑自设例子,非作者实验

编辑自设:两套模型识别同一利好,甲用 1 秒,乙用 30 秒。如果价格在前 2 秒已经跳涨,乙的分类完全正确也未必有交易价值。反过来,低频基本面研究未必需要秒级速度,它更关心这条信息是否改变数月的盈利判断。

  1. 确定新闻首次可得时间
  2. 区分信息抽取与收益预测
  3. 计入处理和成交延迟
  4. 比较成本后收益
  5. 检查不同模型是否拥挤于相同标的
关键结果与解释边界
核对项结果意味着什么
本文材料综述性评论引用别人的回测不构成作者的新验证。
关键区分更快 ≠ 更正确微观报价效率与长期基本面定价不能混为一谈。
可复现持仓NOT_FOUND本篇未提供完整交易记录,不据二手收益数字评高分。

不能推出什么

引用研究未在本条逐篇核验,因此不沿用其中醒目的年化收益作为推荐依据。AI 是否必然增强市场脆弱性仍需独立证据。

研究用途

给新闻模型写清楚任务边界:检索、归因、预测还是执行辅助,并为不同任务设置不同验收指标。

详细讲解

编辑理解

如果所有团队都能低成本读完新闻,优势会留在模型里,还是转移到别处?

从文章到收益至少经过:拿到数据、辨别信息增量、形成预测、成交、承担风险。模型改进只作用于其中一部分。准确抽取公开消息,也可能在价格已经反映消息后才完成。

编辑自设:两套模型识别同一利好,甲用 1 秒,乙用 30 秒。如果价格在前 2 秒已经跳涨,乙的分类完全正确也未必有交易价值。反过来,低频基本面研究未必需要秒级速度,它更关心这条信息是否改变数月的盈利判断。

原文证据

原文实际报告了什么

作者讨论 LLM 对公司新闻、市场信息处理速度及策略拥挤的影响,并引用其他研究的收益和短暂预测效果。本文不是自己新增的完整实验,没有给出可直接复核的新闻时间戳、组合持仓与成交数据。

原文位置:Stock-by-stock sentiment;The main issues AI raises for market efficiency;结尾
编辑理解

为什么值得讨论,哪里不能外推

我更愿意把它读成研究流程的提醒:先定义模型究竟替代哪项人工工作,再选择指标。如果替代新闻初筛,衡量漏报、错报与人工节省时间;如果要直接交易,就必须看延迟后的收益衰减和可成交规模。把这两种目标放在同一张“AI 有效”图里,很容易把生产力收益误认成投资 alpha。

引用研究未在本条逐篇核验,因此不沿用其中醒目的年化收益作为推荐依据。AI 是否必然增强市场脆弱性仍需独立证据。

核查记录

导读完成:核对网页相关方法、结果与限制段落;未逐图及逐行代码审计,未独立复现

四种日期不混用
收录日来源网页日论文首次公开最新版本日
2026-01-202026-01-20待核 / 不适用待核
网页导读核对记录(不是本站回测)
核对项原文 / 状态解读边界
本文材料综述性评论引用别人的回测不构成作者的新验证。
关键区分更快 ≠ 更正确微观报价效率与长期基本面定价不能混为一谈。
可复现持仓NOT_FOUND本篇未提供完整交易记录,不据二手收益数字评高分。

原文位置:Stock-by-stock sentiment;The main issues AI raises for market efficiency;结尾

推荐 53/100 · 问题 23/30 · 证据 10/30 · 方法 16/25 · 复现 4/15

问题框架有启发;主要是二手综述,没有本篇可审计的实验与交易实施。

尚未执行的实验思路

给新闻模型写清楚任务边界:检索、归因、预测还是执行辅助,并为不同任务设置不同验收指标。

返回全年目录 ↑

Quantocracy / 导读完成

新闻语气为负,不等于这家公司遇到了坏消息

What Investors Should Know About Common Sentiment Models: Tone Isn’t Attribution

Tommi Johnsen、Svetlana Shasharina

做股票情绪因子,先确认情绪指向哪家公司,再判断正负。本文的小实验揭示一个接口错配,但没有证明哪种模型能赚取超额收益。

2 分钟看懂

一篇文章整体悲观,为什么给其中提到的股票打负分可能是错的?

普通情绪分类回答“这段文字语气如何”。投资者需要回答“哪条信息改变了哪家公司的经营预期”。这多了一步归因:对象、事件、影响方向,不能把全文平均情绪直接贴到每个 ticker。

编辑自设例子,非作者实验

编辑自设:报道说原材料价格大跌,上游企业承压,下游企业利润改善。若全文打一个负分,再同时分给两家公司,就会把相反的经济影响揉成同一个信号。目标感知不是加一句“请专业分析”,而是要求每个判断对应公司和证据句。

  1. 给定目标公司
  2. 找出与该公司有关的事件和证据句
  3. 隔离无关内容
  4. 判定影响方向
  5. 再评估新闻信号与收益的关系
关键结果与解释边界
核对项结果意味着什么
测试规模9 篇合成文本是诊断案例,不能估计全市场错误率。
模型数量4 个模型任务和标签体系不同,横向排名需谨慎。
可交易收益未测试识别归因错误不等于证明 LLM 修正后有 alpha。

不能推出什么

样本小且刻意构造;没有真实新闻样本外测试、收益检验或目标感知 LLM 的直接对照。作者对全部情绪模型的概括比这个实验能支持的范围更大。

研究用途

先做小型人工标注的公司—证据句—影响方向测试集,比较全文分类、相关句分类、目标感知 LLM;分类误差与策略收益分开评估。

详细讲解

编辑理解

一篇文章整体悲观,为什么给其中提到的股票打负分可能是错的?

普通情绪分类回答“这段文字语气如何”。投资者需要回答“哪条信息改变了哪家公司的经营预期”。这多了一步归因:对象、事件、影响方向,不能把全文平均情绪直接贴到每个 ticker。

编辑自设:报道说原材料价格大跌,上游企业承压,下游企业利润改善。若全文打一个负分,再同时分给两家公司,就会把相反的经济影响揉成同一个信号。目标感知不是加一句“请专业分析”,而是要求每个判断对应公司和证据句。

原文证据

原文实际报告了什么

作者构造 9 篇合成文本,把 NVIDIA 的正/中/负财务信息与不相关的正/中/负情绪段落组合,测试 FinBERT、Twitter-RoBERTa、SieBERT 和 NLPTown。作者报告:无关情绪会干扰目标公司的分类,尤其在财务信息中性时。样本是人工压力测试,不是真实新闻收益回测。

原文位置:Experiment Setup;Models Tested;Conclusions(结果表未逐格审计)
编辑理解

为什么值得讨论,哪里不能外推

我的判断是这篇的问题价值高于实验强度。它能说明现有流水线可能把任务交错了,却不足以证明通用模型都不会归因,更不能证明必须使用大模型。更便宜的实体识别加相关句筛选,应当是必要基线。测试还应加入一条信息同时影响竞争者的真实情境,因为“无关旅游段落”容易暴露极端问题,却不代表日常新闻分布。

样本小且刻意构造;没有真实新闻样本外测试、收益检验或目标感知 LLM 的直接对照。作者对全部情绪模型的概括比这个实验能支持的范围更大。

核查记录

导读完成:核对网页相关方法、结果与限制段落;未逐图及逐行代码审计,未独立复现

四种日期不混用
收录日来源网页日论文首次公开最新版本日
2026-01-192026-01-14待核 / 不适用待核
网页导读核对记录(不是本站回测)
核对项原文 / 状态解读边界
测试规模9 篇合成文本是诊断案例,不能估计全市场错误率。
模型数量4 个模型任务和标签体系不同,横向排名需谨慎。
可交易收益未测试识别归因错误不等于证明 LLM 修正后有 alpha。

原文位置:Experiment Setup;Models Tested;Conclusions(结果表未逐格审计)

推荐 74/100 · 问题 29/30 · 证据 14/30 · 方法 20/25 · 复现 11/15

直接击中新闻因子的归因风险;仅 9 个合成案例、没有策略对照,证据分受限。

尚未执行的实验思路

先做小型人工标注的公司—证据句—影响方向测试集,比较全文分类、相关句分类、目标感知 LLM;分类误差与策略收益分开评估。

返回全年目录 ↑

Quantocracy / 导读完成

指数头部权重很高,为什么仍不构成减仓信号?

The Fallacy of Concentration Risk

Mark Kritzman、David Turkington;Quantpedia 导读

集中度描述今天持仓长什么样,不自动告诉你明天收益如何。本文导读挑战的是用集中度择时,不是说集中持仓没有风险。

2 分钟看懂

头部公司占指数一大半,是风险测量问题,还是一个能赚钱的择时信号?

要把状态指标变成交易信号,需要证明它对未来有增量预测作用。即使一个组合更依赖少数公司,也不意味着当前价格没有补偿这种风险,或者你能判断风险何时兑现。

编辑自设例子,非作者实验

编辑自设:10 只等权股票的有效数量为 1/Σw²=10;若一只占 50%,另外九只均分剩余,有效数量约 3.6。它直观反映权重不均,但没有用到股票之间的相关性:十只同产业股票也可能同时受一个冲击影响。

  1. 计算权重集中程度
  2. 明确预测的是未来收益还是未来风险
  3. 与相同风险暴露基准比较
  4. 再决定是否有交易价值
关键结果与解释边界
核对项结果意味着什么
集中指标有效股票数量权重分散程度,不等于独立风险源数量。
择时对照相同事后平均股票暴露用于区分减仓本身与择时的效果;不是可事前知道的配置。
本站证据层级已读导读,未审论文全文原论文链接保留,不把转述升级为独立全文核查。

不能推出什么

本条仅核对 Quantpedia 正文及其研究引用,未获得并审计底层回归和原始数据。理论均衡论证不能替代实证的统计功效。

研究用途

在风险报告中分开写“集中度状态”和“预期收益判断”;没有独立预测证据时,不让前者自动触发整体减仓。

详细讲解

编辑理解

头部公司占指数一大半,是风险测量问题,还是一个能赚钱的择时信号?

要把状态指标变成交易信号,需要证明它对未来有增量预测作用。即使一个组合更依赖少数公司,也不意味着当前价格没有补偿这种风险,或者你能判断风险何时兑现。

编辑自设:10 只等权股票的有效数量为 1/Σw²=10;若一只占 50%,另外九只均分剩余,有效数量约 3.6。它直观反映权重不均,但没有用到股票之间的相关性:十只同产业股票也可能同时受一个冲击影响。

原文证据

原文实际报告了什么

Quantpedia 介绍 The Fallacy of Concentration:研究用有效股票数量衡量集中程度,并检验未来收益和风险。导读称集中度的预测贡献很小;按集中度减持股票的规则,弱于具有相同事后平均股票暴露的买入持有对照。

原文位置:Quantpedia 开头的结果综述;所引研究 Exhibits 4–6;SSRN 原地址
编辑理解

为什么值得讨论,哪里不能外推

我的判断是不要把“未发现预测力”读成“风险不存在”。组合经理仍然可以为了单名风险预算而限制权重,这与预测指数要跌是不同目标。还需要问集中于谁:同样的集中指标可能对应不同盈利质量、业务相关性与估值水平。一个单变量没有预测力,不能排除条件关系,也不能支持当前市场必然安全。

本条仅核对 Quantpedia 正文及其研究引用,未获得并审计底层回归和原始数据。理论均衡论证不能替代实证的统计功效。

核查记录

导读完成:已核 Quantpedia 网页;底层 SSRN 论文全文及回归尚未审计。

四种日期不混用
收录日来源网页日论文首次公开最新版本日
2026-01-192026-01-19待核 / 不适用待核
网页导读核对记录(不是本站回测)
核对项原文 / 状态解读边界
集中指标有效股票数量权重分散程度,不等于独立风险源数量。
择时对照相同事后平均股票暴露用于区分减仓本身与择时的效果;不是可事前知道的配置。
本站证据层级已读导读,未审论文全文原论文链接保留,不把转述升级为独立全文核查。

原文位置:Quantpedia 开头的结果综述;所引研究 Exhibits 4–6;SSRN 原地址

推荐 69/100 · 问题 27/30 · 证据 15/30 · 方法 21/25 · 复现 6/15

问题和对照有价值;当前只完成导读层核验,原论文表格与数据尚待审读。

尚未执行的实验思路

在风险报告中分开写“集中度状态”和“预期收益判断”;没有独立预测证据时,不让前者自动触发整体减仓。

返回全年目录 ↑

Quantocracy / 导读完成

让 LLM 给动量候选股做新闻复核:有改善,但还不是稳固的 alpha 证据

Can AI Read the News Better Than You? How ChatGPT Could Transform Momentum Investing

Nikolas Anic、Andrea Barbon、Ralf Seiz、Carlo Zarattini

LLM 在这里不是从零选股,而是在动量候选中重排和调整权重。测试期改善值得关注,但短样本、参数筛选和模型时点仍限制结论。

2 分钟看懂

两只股票过去都涨得很好,能否用最新公司新闻判断哪一只更值得继续持有?

基线是 S&P 500 范围内的做多动量,不是市场指数择时。新闻模型只在强势股票里做第二轮判断。因此超越这个基准,最多说明新闻层可能有增量,不能说明 LLM 可以独立替代整个选股系统。

编辑自设例子,非作者实验

编辑自设:甲乙基础权重相同,LLM 原始分为 0.8 和 0.6;若线性转成 -1 到 1,则分别为 0.6 和 0.2。用论文的指数倾斜形式、倍率 5,未归一化权重比为 5^(0.6−0.2)≈1.90。不是给甲配 80%、乙配 60%;最后还需归一化与约束。这里只演示两股算术,不是论文持仓。

  1. 过去 12 个月收益跳过最近月,取前两成候选
  2. 读截至调仓前的公司新闻标题与摘要
  3. LLM 评分并重排候选
  4. 选择 50 只,以市值权重乘以 5 的标准化分数次方
  5. 归一化、约束并按月再平衡
关键结果与解释边界
核对项结果意味着什么
测试期15 个月 / 312 日来自 Table 1;不能把 312 日看成 312 个独立市场环境。
样本外 Sharpe0.79 → 1.06Table 3,含论文假设的 2bp 成本,未计本站实际执行。
相对基准 alpha3.26% / 10% 显著水平§3.3:正向但统计证据较弱,不是确定的超额收益。

不能推出什么

正文写周/月调仓,Table 2 的候选却写 Day/Month;方法新闻截止时间与提示示例也不完全相同,复现前须澄清。原文没有足够细节让本站确认数据与 API 的全部时点一致;不得把模型分数视为校准概率。独立数据和代码未运行。

研究用途

复现设计应增加同样持股数/权重约束的无 LLM 对照、打乱新闻对照,以及仅新闻数量或简单情绪基线;记录所有提示和模型版本。本文推荐的是研究设计,不是直接交易。

详细讲解

编辑理解

两只股票过去都涨得很好,能否用最新公司新闻判断哪一只更值得继续持有?

基线是 S&P 500 范围内的做多动量,不是市场指数择时。新闻模型只在强势股票里做第二轮判断。因此超越这个基准,最多说明新闻层可能有增量,不能说明 LLM 可以独立替代整个选股系统。

编辑自设:甲乙基础权重相同,LLM 原始分为 0.8 和 0.6;若线性转成 -1 到 1,则分别为 0.6 和 0.2。用论文的指数倾斜形式、倍率 5,未归一化权重比为 5^(0.6−0.2)≈1.90。不是给甲配 80%、乙配 60%;最后还需归一化与约束。这里只演示两股算术,不是论文持仓。

原文证据

原文实际报告了什么

原论文 v1 的 Table 3 报告,2024-01 至 2025-03 测试期 Sharpe 为 0.79→1.06、年化收益 24%→30%、最大回撤 -19%→-17%,假设每笔交易成本 2bp。正文另报相对基准年化 alpha 3.26%,仅在 10% 水平显著。参数由 2019-10 至 2023-12 期间的 512 组候选选出。

原文位置:原论文 §2.1–2.4;Table 1–3;§3.3 的 alpha 段;§4 限制
编辑理解

为什么值得讨论,哪里不能外推

值得肯定的是它有明确的传统信号基线,也没有把模型吐出的概率直接当持仓比例。但我会优先做三个区分。第一,改善来自删除股票还是改变权重?两步需要单独对照,否则难以知道哪一步有效。第二,LLM 分数是否只是新闻多、规模大或科技行业的代理?需要控制这些暴露。第三,测试期是事后用固定模型处理历史文本,不等于当时已真实运行。原文以训练截止日宣称完全无泄漏过强;仍须核对准确模型快照、调用日期、新闻修订与成分股时点。

正文写周/月调仓,Table 2 的候选却写 Day/Month;方法新闻截止时间与提示示例也不完全相同,复现前须澄清。原文没有足够细节让本站确认数据与 API 的全部时点一致;不得把模型分数视为校准概率。独立数据和代码未运行。

核查记录

已读 arXiv v1 方法、结果表及限制;保持导读完成,未逐图审计、取得原始数据或独立运行。

四种日期不混用
收录日来源网页日论文首次公开最新版本日
2026-01-192026-01-162025-10-30待核
网页导读核对记录(不是本站回测)
核对项原文 / 状态解读边界
测试期15 个月 / 312 日来自 Table 1;不能把 312 日看成 312 个独立市场环境。
样本外 Sharpe0.79 → 1.06Table 3,含论文假设的 2bp 成本,未计本站实际执行。
相对基准 alpha3.26% / 10% 显著水平§3.3:正向但统计证据较弱,不是确定的超额收益。

原文位置:原论文 §2.1–2.4;Table 1–3;§3.3 的 alpha 段;§4 限制

推荐 81/100 · 问题 29/30 · 证据 20/30 · 方法 23/25 · 复现 9/15

有原论文、明确对照和独立时间段;短测试期、弱显著 alpha、内部数据和实现歧义限制了证据与复现分。

尚未执行的实验思路

复现设计应增加同样持股数/权重约束的无 LLM 对照、打乱新闻对照,以及仅新闻数量或简单情绪基线;记录所有提示和模型版本。本文推荐的是研究设计,不是直接交易。

返回全年目录 ↑

Quantocracy / 导读完成

策略该上观察名单了吗?这里的阈值是 Q1 − 1.5 × IQR

New Feature: The Underperformer Watchlist

Allocate Smartly

这不是挑近期最差策略,而是找出明显偏离自身历史预期的策略。进入名单代表需要调查,不等于策略死亡,也不是抄底信号。

2 分钟看懂

两个策略最近都亏 10%,为什么只有其中一个需要报警?

波动很大的策略亏 10% 可能正常,平时很平稳的策略同样亏损却可能异常。比较对象应当是它自己事前的合理范围,而不是只按近期收益排倒数。

编辑自设例子,非作者实验

编辑自设:若历史相同口径收益的 Q1 为 2%、Q3 为 10%,IQR=8 个百分点,则进入阈值为 2%−1.5×8%=-10%。当前收益 -12% 会报警,恢复到 -5% 仍未达到 2% 的退出门槛。这种进出门槛不同的设计,减少边缘附近反复切换;数字不是原文某策略数据。

  1. 分别计算多个 n 月收益
  2. 用 n 个月前的信息形成历史分布门槛
  3. 低于 Q1−1.5×IQR 进入观察
  4. 检查数据、暴露与过拟合原因
  5. 超过 Q1 才解除对应警报
关键结果与解释边界
核对项结果意味着什么
进入门槛Q1 − 1.5 × IQRIQR=Q3−Q1;不是亏损达到固定百分比。
窗口12 / 18 / 24 / 30 / 36 月是原作者监控窗口,不是本站重新优化出来的值。
退出门槛Q1与进入不同;报警不等于自动清仓。

不能推出什么

公开说明没有给出这套名单改善未来净收益的充分对照,也未完整公开历史分布估计的全部实现细节。有限样本下分位数本身也不稳定。

研究用途

将报警、调查结论与后续表现留档;在当前样本足够的窗口上做监控,不为了照搬所有窗口而拼接不可靠的历史。

详细讲解

编辑理解

两个策略最近都亏 10%,为什么只有其中一个需要报警?

波动很大的策略亏 10% 可能正常,平时很平稳的策略同样亏损却可能异常。比较对象应当是它自己事前的合理范围,而不是只按近期收益排倒数。

编辑自设:若历史相同口径收益的 Q1 为 2%、Q3 为 10%,IQR=8 个百分点,则进入阈值为 2%−1.5×8%=-10%。当前收益 -12% 会报警,恢复到 -5% 仍未达到 2% 的退出门槛。这种进出门槛不同的设计,减少边缘附近反复切换;数字不是原文某策略数据。

原文证据

原文实际报告了什么

网站使用 12、18、24、30、36 个月滚动收益,分别考察绝对收益及相对策略专属基准的收益。当前 n 月收益低于 n 个月前测得的 Q1−1.5×IQR 时标记,恢复超过当时对应的 Q1 门槛才移出;基准按截至当时的平均资产配置构建。

原文位置:The math for the nerds;How we would use the Underperformer Watchlist
编辑理解

为什么值得讨论,哪里不能外推

这篇的实用价值在于把“看起来不对”变成可记录的规则,但 1.5 倍四分位距是异常值经验门槛,不是失效概率 95% 的同义词。同时监控多个窗口和多个策略,会增加报警机会;滚动收益还高度重叠。我的建议是把名单当人工调查队列,另行验证整套监控政策的误报、漏报和交易代价,而不是把统计警报直接接到清仓按钮。

公开说明没有给出这套名单改善未来净收益的充分对照,也未完整公开历史分布估计的全部实现细节。有限样本下分位数本身也不稳定。

核查记录

导读完成:核对网页相关方法、结果与限制段落;未逐图及逐行代码审计,未独立复现

四种日期不混用
收录日来源网页日论文首次公开最新版本日
2026-01-162026-01-15待核 / 不适用待核
网页导读核对记录(不是本站回测)
核对项原文 / 状态解读边界
进入门槛Q1 − 1.5 × IQRIQR=Q3−Q1;不是亏损达到固定百分比。
窗口12 / 18 / 24 / 30 / 36 月是原作者监控窗口,不是本站重新优化出来的值。
退出门槛Q1与进入不同;报警不等于自动清仓。

原文位置:The math for the nerds;How we would use the Underperformer Watchlist

推荐 80/100 · 问题 28/30 · 证据 19/30 · 方法 23/25 · 复现 10/15

阈值和进出规则清楚;监控政策的样本外经济价值、误报率与实现细节仍待验证。

尚未执行的实验思路

将报警、调查结论与后续表现留档;在当前样本足够的窗口上做监控,不为了照搬所有窗口而拼接不可靠的历史。

返回全年目录 ↑

Quantocracy / 导读完成

Delta 对冲用隐波还是历史波动?先别把“已知未来波动”偷换成历史估计

Implied vs. Realized Volatility in Delta Hedging Strategies

Relative Value Arbitrage / Harbourfront

理论上已知未来实际波动,和实盘用过去波动去预测,是两个不同问题。对冲输入的优劣取决于评价到期收益、期间净值还是成本后误差。

2 分钟看懂

用市场隐含波动计算 Delta,和用自己预测的波动计算 Delta,分别在对冲什么风险?

Delta 是价格对标的变化的一阶敏感度,它取决于定价输入。实际交易还面临离散调仓、跳跃、价差和波动曲面变化,所以“模型中的对冲”不等于“实盘消除了风险”。

编辑自设例子,非作者实验

编辑自设:你预测未来波动 15%,市场隐波 25%,于是想赚取波动差。若未来跳跃导致实际波动 35%,历史估计并没有任何保证。即使最终实际波动较低,有限频率对冲和交易成本也可能吃掉价差;预测方向正确不等于每条路径都赚钱。

  1. 区分隐波、历史估计与未来实际波动
  2. 明确关注到期还是期间损益
  3. 固定对冲频率与成交成本
  4. 在相同持仓上比较误差与尾部风险
关键结果与解释边界
核对项结果意味着什么
理论输入未来实际波动已知这是理想化前提,不能用历史样本估计冒充。
实证对象QQQ 期权导读中的短样本,不是所有期权市场。
通用最优频率未由本文给出波动输入与对冲频率需要分开检验。

不能推出什么

本条仅核读导读,未完整审读其两篇底层论文;没有复核短样本期权报价、成本与对冲计算。不延伸至本项目排除的转债。

研究用途

后续若研究对冲,采用同样初始期权头寸和调仓时点,只替换波动输入,并分别报告成本、均方误差与尾部损失。

详细讲解

编辑理解

用市场隐含波动计算 Delta,和用自己预测的波动计算 Delta,分别在对冲什么风险?

Delta 是价格对标的变化的一阶敏感度,它取决于定价输入。实际交易还面临离散调仓、跳跃、价差和波动曲面变化,所以“模型中的对冲”不等于“实盘消除了风险”。

编辑自设:你预测未来波动 15%,市场隐波 25%,于是想赚取波动差。若未来跳跃导致实际波动 35%,历史估计并没有任何保证。即使最终实际波动较低,有限频率对冲和交易成本也可能吃掉价差;预测方向正确不等于每条路径都赚钱。

原文证据

原文实际报告了什么

文章并列介绍 Ahmad 与 Wilmott 的 2005 年理论讨论,以及 Zhao 的 QQQ 期权短样本研究。前者在理想条件下比较已知实际波动与隐含波动对冲,后者比较历史估计与市场隐波;导读称后者的隐波对冲较平稳,但样本只有数月。

原文位置:Which Free Lunch Would You Like Today Sir?;Delta Hedging with Implied vs. Historical Volatility;References
编辑理解

为什么值得讨论,哪里不能外推

我的核心意见是别把这两篇研究合成一句“隐波永远更好”。理论结果依赖连续模型的假设;实证比较还取决于历史估计器、样本行情和交易口径。导读中的平滑或零方差措辞,不能延伸为真实市场无风险。对研究员最有用的是先定义损失函数:平均对冲误差小与极端误差小,也不是同一个目标。

本条仅核读导读,未完整审读其两篇底层论文;没有复核短样本期权报价、成本与对冲计算。不延伸至本项目排除的转债。

核查记录

导读完成:已读 Harbourfront;两篇底层论文与原始数据未完整核查。

四种日期不混用
收录日来源网页日论文首次公开最新版本日
2026-01-162026-01-15待核 / 不适用待核
网页导读核对记录(不是本站回测)
核对项原文 / 状态解读边界
理论输入未来实际波动已知这是理想化前提,不能用历史样本估计冒充。
实证对象QQQ 期权导读中的短样本,不是所有期权市场。
通用最优频率未由本文给出波动输入与对冲频率需要分开检验。

原文位置:Which Free Lunch Would You Like Today Sir?;Delta Hedging with Implied vs. Historical Volatility;References

推荐 61/100 · 问题 25/30 · 证据 12/30 · 方法 19/25 · 复现 5/15

揭示重要输入差异;当前只有导读、理论与实证假设不可混用,数据与实现尚未核验。

尚未执行的实验思路

后续若研究对冲,采用同样初始期权头寸和调仓时点,只替换波动输入,并分别报告成本、均方误差与尾部损失。

返回全年目录 ↑

Quantocracy / 导读完成

策略亏了两年就该关掉吗?一个事后反弹不能给出答案

Much Ado About Variance

Kris Longmore

亏损可能只是噪声,但“只是噪声”也不能成为永不下线的借口。真正可复用的是事前制定监控规则,而不是在反弹后总结纪律。

2 分钟看懂

观察到亏损以后,怎么区分正常低谷和真实失效?

单看最近盈亏无法回答。还要知道策略原本有多吵、暴露是否变化、数据或执行是否出错,以及停止交易的代价。证明亏损不罕见,不等于证明策略仍有正期望。

编辑自设例子,非作者实验

编辑自设:在年度收益正态、均值和波动均为 10% 的简化模型下,负收益概率约 16%。但这是假设真实参数已知;实际研究中 Sharpe 本身要估计,收益还有相关性和厚尾。因此不能把 16% 直接当作自己策略的失效报警概率。

  1. 交易前写下可接受波动范围
  2. 亏损时先核对数据与执行
  3. 区分市场暴露变化与异常残差
  4. 用预先规定的规则决定降风险或继续
关键结果与解释边界
核对项结果意味着什么
历史量级Sharpe 约 1作者报告,不是已知不变的真实参数。
2025 假设继续交易约 15% / 1.8收益 / Sharpe;是作者的事后反事实,不是其实际持有收益。
停用阈值未给出通用值不能据此得出亏两年都应该坚持。

不能推出什么

单个策略的事后反弹不能证明坚持优于停用。因果机制没有被直接观测,本文也没有检验一套统一下线政策。

研究用途

建立异常处理表,分别记录数据质量、执行偏差、风险暴露和收益异常;每项对应事前处理规则。

详细讲解

编辑理解

观察到亏损以后,怎么区分正常低谷和真实失效?

单看最近盈亏无法回答。还要知道策略原本有多吵、暴露是否变化、数据或执行是否出错,以及停止交易的代价。证明亏损不罕见,不等于证明策略仍有正期望。

编辑自设:在年度收益正态、均值和波动均为 10% 的简化模型下,负收益概率约 16%。但这是假设真实参数已知;实际研究中 Sharpe 本身要估计,收益还有相关性和厚尾。因此不能把 16% 直接当作自己策略的失效报警概率。

原文证据

原文实际报告了什么

作者回顾暂停月末债券策略的决定,称该策略历史 Sharpe 约 1,2023 年后经历弱势;若 2025 年继续执行,扣成本收益约 15%、Sharpe 1.8。他以此提醒:为亏损寻找合理故事,可能导致把波动误判成失效。

原文位置:One Glaring Lesson;The Psychology of Abandoning a Sharpe 1 Strategy;预设期望段
编辑理解

为什么值得讨论,哪里不能外推

这篇有价值,因为作者承认叙事会随净值变化。但证据也有幸存者问题:我们听到的是后来反弹的策略,没看到同样坚持后继续亏损的全部案例。我的建议是把监控分为两类。数据错、信号错、成交错属于明确故障,可以立即处理;纯收益低于期望属于统计问题,需要结合不确定性和资金承受能力。不要把两类都归入“市场变了”。

单个策略的事后反弹不能证明坚持优于停用。因果机制没有被直接观测,本文也没有检验一套统一下线政策。

核查记录

导读完成:核对网页相关方法、结果与限制段落;未逐图及逐行代码审计,未独立复现

四种日期不混用
收录日来源网页日论文首次公开最新版本日
2026-01-112026-01-11待核 / 不适用待核
网页导读核对记录(不是本站回测)
核对项原文 / 状态解读边界
历史量级Sharpe 约 1作者报告,不是已知不变的真实参数。
2025 假设继续交易约 15% / 1.8收益 / Sharpe;是作者的事后反事实,不是其实际持有收益。
停用阈值未给出通用值不能据此得出亏两年都应该坚持。

原文位置:One Glaring Lesson;The Psychology of Abandoning a Sharpe 1 Strategy;预设期望段

推荐 71/100 · 问题 27/30 · 证据 16/30 · 方法 21/25 · 复现 7/15

对策略治理有用且坦诚;单案例、事后反事实与缺少统一策略对照限制了证据强度。

尚未执行的实验思路

建立异常处理表,分别记录数据质量、执行偏差、风险暴露和收益异常;每项对应事前处理规则。

返回全年目录 ↑

Quantocracy / 导读完成

相关矩阵有空白,为什么不能直接填零?

Completing a Correlation Matrix: Another Problem from Finance

Portfolio Optimizer

填零不是中立处理,而是额外假设。矩阵补全首先保证整体合法,再在可能的解中做选择;数学合法仍不等于未来预测正确。

2 分钟看懂

几个研究团队分别交来局部相关性,拼成一个大矩阵后为什么风险系统可能算不下去?

每个相关系数在 -1 到 1 之间还不够。整个矩阵必须半正定,意思是任何权重组合算出的方差都不能为负。各小块单独合理,合起来也可能不相容。

编辑自设例子,非作者实验

编辑自设:已知 Corr(A,B)=0.9,Corr(A,C)=0.9,未知 Corr(B,C)=x。三变量矩阵的非负行列式要求 x 在 0.62 到 1 之间。若填零,得到不合法矩阵;最大行列式选择 x=0.81。这是自设三变量算例,不是原文机构预测,也不说明未来相关性就等于 0.81。

  1. 统一资产、币种、期限与数据口径
  2. 标记已知值与缺失值
  3. 检验能否保留已知值并合法补全
  4. 必要时记录对原值的修正
  5. 对不同补全假设做风险敏感性比较
关键结果与解释边界
核对项结果意味着什么
基本约束对称、对角为 1、半正定单个系数不越界并不足够。
求解状态可能无解或多解不能强迫系统悄悄返回一个看似精确的结果。
补全含义条件性假设不是凭数学恢复从未观测到的真实市场数据。

不能推出什么

专有实现不是完整开源复现。最大行列式的统计解释依赖模型假设;财务尾部共同风险不能由相关矩阵完整表达。本站未调用 API 或运行作者算法。

研究用途

建立风险输入检查:缺失位置、最小特征值、原值改变量、下游权重敏感性。补全失败必须显式报告。

详细讲解

编辑理解

几个研究团队分别交来局部相关性,拼成一个大矩阵后为什么风险系统可能算不下去?

每个相关系数在 -1 到 1 之间还不够。整个矩阵必须半正定,意思是任何权重组合算出的方差都不能为负。各小块单独合理,合起来也可能不相容。

编辑自设:已知 Corr(A,B)=0.9,Corr(A,C)=0.9,未知 Corr(B,C)=x。三变量矩阵的非负行列式要求 x 在 0.62 到 1 之间。若填零,得到不合法矩阵;最大行列式选择 x=0.81。这是自设三变量算例,不是原文机构预测,也不说明未来相关性就等于 0.81。

原文证据

原文实际报告了什么

文章讨论保留已知相关系数、补全缺失值的问题,强调解不一定存在,也不一定唯一。最大行列式方法在适当可行条件下选出一个解;已知输入相互矛盾时,还要调整原值。网页以机构资本市场假设的缺失矩阵展示应用。

原文位置:Existence / Unicity;Maximum determinant;Infeasible problem;Example of usage
编辑理解

为什么值得讨论,哪里不能外推

值得提醒一处原文表述:C2 例子包含非对角相关系数 1,对应二阶主块奇异,不能据此声称严格正定补全;半正定与正定要区分。我的使用建议是保留输入改动账本。若算法为了可行性大幅改动已知值,应该首先复查口径,而不是把修正结果直接送进优化器。可行性修复、统计估计和投资预测是三项不同工作。

专有实现不是完整开源复现。最大行列式的统计解释依赖模型假设;财务尾部共同风险不能由相关矩阵完整表达。本站未调用 API 或运行作者算法。

核查记录

导读完成:核对网页相关方法、结果与限制段落;未逐图及逐行代码审计,未独立复现

四种日期不混用
收录日来源网页日论文首次公开最新版本日
2026-01-06待核待核 / 不适用待核
网页导读核对记录(不是本站回测)
核对项原文 / 状态解读边界
基本约束对称、对角为 1、半正定单个系数不越界并不足够。
求解状态可能无解或多解不能强迫系统悄悄返回一个看似精确的结果。
补全含义条件性假设不是凭数学恢复从未观测到的真实市场数据。

原文位置:Existence / Unicity;Maximum determinant;Infeasible problem;Example of usage

推荐 83/100 · 问题 28/30 · 证据 22/30 · 方法 24/25 · 复现 9/15

数学定义和反例清楚,能防止实际风险管线错误;个别正定措辞需纠正,专有实现限制复现。

尚未执行的实验思路

建立风险输入检查:缺失位置、最小特征值、原值改变量、下游权重敏感性。补全失败必须显式报告。

返回全年目录 ↑

Quantocracy / 导读完成

黄金与美债双动量:简单规则值得试,宏观解释还没有被证明

Cross-Asset Price-Based Regimes for Gold

Cyril Dujava / Quantpedia

可读之处是把两个价格信号拆成四种状态;应保留的怀疑是:挑出最好状态与窗口后,不能直接称为独立样本外证明。

2 分钟看懂

美债上涨是否提供了黄金自身趋势以外的信息?

必须先与黄金单动量比较,才能知道第二个信号的增量。再与相同平均黄金暴露的基准比较,才能区分预测改善和仅仅少持有黄金的效果。

编辑自设例子,非作者实验

编辑自设:黄金和债券的动量各有正负两种状态,组合成四格。如果在同一段历史里找出表现最好的一格,再只展示那格的收益,就有挑选赢家的偏差。状态解释再合理,也不能让这次选择自动变成事前选择。

  1. 分别计算两类资产过去收益
  2. 划分四种正负组合
  3. 比较黄金持有与单信号基准
  4. 明确窗口和状态的选择过程
  5. 在未参与选择的数据上再评价
关键结果与解释边界
核对项结果意味着什么
候选窗口1 / 3 / 6 / 12 月最后采用 12 月,是考察多个候选后的选择。
交易规则双正才持有黄金债券是输入信号,不是同时持有的资产。
早期数据内部重建序列不是 1969 年就存在 GLD、IEF ETF。

不能推出什么

原文虽使用样本外措辞,但可见方法未明确给出独立的选择/验证切分;图中绩效数值本条未逐格审计。成本、拼接规则和现金代理均需另核。

研究用途

结合 Allocate Smartly 的独立讨论阅读。后续若复现,冻结规则与候选集合,分别报告真实 ETF 样本、合成历史和净成本结果。

详细讲解

编辑理解

美债上涨是否提供了黄金自身趋势以外的信息?

必须先与黄金单动量比较,才能知道第二个信号的增量。再与相同平均黄金暴露的基准比较,才能区分预测改善和仅仅少持有黄金的效果。

编辑自设:黄金和债券的动量各有正负两种状态,组合成四格。如果在同一段历史里找出表现最好的一格,再只展示那格的收益,就有挑选赢家的偏差。状态解释再合理,也不能让这次选择自动变成事前选择。

原文证据

原文实际报告了什么

研究比较黄金与 IEF 的正负动量组合及 1、3、6、12 个月窗口,最终采用月度更新的 12 个月双正信号:两者总收益均大于零时 100% 配置黄金,否则为零或现金。历史范围为 1969-12-31 至 2025-09-30,ETF 出现前用内部重建数据。

原文位置:Data;Joint Momentum States;Annual Joint-Momentum Allocation Rule;Discussion & Conclusion
编辑理解

为什么值得讨论,哪里不能外推

我认为有两个必须拆开的命题:双信号是否预测黄金,以及它是否识别真实利率下降。第一项可以用价格序列检验;第二项还需直接对照真实利率、通胀预期等变量。名义债券总收益包含票息、久期和名义利率变化,不是实际利率的无误差代理。另一个问题是现金利息:持有更长时间现金,本身就会改变结果,不能把全部改善都归于预测能力。

原文虽使用样本外措辞,但可见方法未明确给出独立的选择/验证切分;图中绩效数值本条未逐格审计。成本、拼接规则和现金代理均需另核。

核查记录

导读完成:核对网页相关方法、结果与限制段落;未逐图及逐行代码审计,未独立复现

四种日期不混用
收录日来源网页日论文首次公开最新版本日
2026-01-042026-01-04待核 / 不适用待核
网页导读核对记录(不是本站回测)
核对项原文 / 状态解读边界
候选窗口1 / 3 / 6 / 12 月最后采用 12 月,是考察多个候选后的选择。
交易规则双正才持有黄金债券是输入信号,不是同时持有的资产。
早期数据内部重建序列不是 1969 年就存在 GLD、IEF ETF。

原文位置:Data;Joint Momentum States;Annual Joint-Momentum Allocation Rule;Discussion & Conclusion

推荐 74/100 · 问题 26/30 · 证据 17/30 · 方法 21/25 · 复现 10/15

可执行规则和基线明确;候选选择、内部历史数据和独立验证边界限制了可信度。

尚未执行的实验思路

结合 Allocate Smartly 的独立讨论阅读。后续若复现,冻结规则与候选集合,分别报告真实 ETF 样本、合成历史和净成本结果。

返回全年目录 ↑

AI / 研究补充 / 正文核查完成

Engram:把“记住知识”和“动脑推理”分开,为什么反而更聪明?

Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models

Xin Cheng、Wangding Zeng、Damai Dai 等

不只是给模型加一个更大的记忆库。真正有价值的实验是:总参数和计算预算相同,把部分专家参数换成查表,推理分数仍然上升。

2 分钟看懂

模型每遇到一个熟悉术语,是否都值得重新花算力处理?

传统模型把记忆常见搭配和处理新关系都交给网络计算;Engram 尝试让一部分重复模式直接查表。

编辑自设例子,非作者实验

可以把它想成研究员手边的术语表:查表省下力气,但“这个解释在本句是否适用”仍需判断。这是帮助理解的类比,不是作者做了一个财务知识库。

  1. 读取局部词元组合
  2. 哈希查出记忆向量
  3. 结合上下文判断是否采用
  4. 把结果交给后续网络推理
关键结果与解释边界
核对项结果意味着什么
同预算 BBH50.9 → 55.9在总参数和激活参数对齐时,推理测试仍改善,不只是模型变大。
代码测试 HumanEval37.8 → 40.8改善也出现在代码任务;不能直接换算成生产代码可用率。
参数对照26.7B / 3.8B两组总参数 26.7B、激活参数 3.8B,训练量同为 262B tokens。

不能推出什么

训练内部记忆不等于实时、可审计的金融数据库。等计算量也不必然等实际时延。

研究用途

对应用研究员更有用的启发是区分可查表的确定性操作与真正需要推理的工作。

详细讲解

编辑理解

模型每次读到一个熟悉名称,都有必要重新推导一遍吗?

让一个研究员每天重新查清“EBITDA”是什么意思,再开始做估值,显然是在浪费他的注意力。模型也可能存在类似的资源错配:大量高频名称和局部搭配具有重复性,却仍占用网络的计算深度。

Engram 最值得读的地方,是把这个直觉变成了可以比较的架构问题:有限的模型预算,究竟应该给动态计算,还是给静态模式存储?注意,这不是在应用外面加 RAG,也不是把聊天记录存进向量数据库;它讨论的是模型内部的参数如何分工。

原文证据

方法的关键:查出来的东西,仍要让上下文决定能不能用

Engram 用局部 N-gram 生成确定性地址,经过词元压缩、多头哈希取得记忆向量,再通过当前隐藏状态参与的门控把它融入主干网络。查表提供候选表示,而不是无条件把同一条知识塞给所有上下文。

确定性寻址还有系统意义:地址能预先计算,CPU 内存中的表项可以提前搬运,与 GPU 计算重叠。但查表是 O(1),不代表端到端推理没有带宽、传输或缓存成本。

原文位置:§2.1–2.5
原文证据

最有说服力的对照,不是 40B 赢了 27B

Table 1 中更干净的比较是 MoE-27B 对 Engram-27B:两者总参数都是 26.7B,激活参数都是 3.8B,训练量都是 262B tokens。Engram 把部分 routed experts 换成 5.7B 的记忆参数。

这组对照下,BBH 从 50.9 到 55.9,HumanEval 从 37.8 到 40.8,MATH 从 28.3 到 30.7。它不只是知识题变好,推理、代码也改善。另一个更大记忆版本 Engram-40B 并非全指标更好:HumanEval 为 38.4,反而低于 Engram-27B 的 40.8。

同预算架构对照:分数变化均为百分点
指标MoE-27BEngram-27B变化
BBH EM50.955.9+5.0
HumanEval Pass@137.840.8+3.0
MATH EM28.330.7+2.4
MMLU Accuracy57.460.4+3.0
原文位置:Table 1
原文证据

20%–25% 不是通用配方,而是所测规模里的最优区间

固定稀疏参数预算的实验呈现 U 形损失曲线:几乎全给 MoE,静态模式仍需计算;过多给记忆,又挤掉处理动态关系的能力。在两档测试规模上,约 20%–25% 稀疏参数分给 Engram 最好。作者用中间层表征分析支持“减轻早期静态重建负担”的解释。

原文位置:§3.1;§5
编辑理解

为什么这对量化研究员有启发,但不是一个新 alpha

核心迁移不是“我们也训练一个 Engram”,而是重新划分系统中哪些工作需要判断。证券代码映射、单位换算、公告版本、字段定义应由可追溯的结构化层处理;对证据冲突的判断、跨文档关系的推理才交给模型。这只是受论文启发的工程原则,不能说作者已验证这种投研系统。

也不要把内部记忆当实时金融数据库。模型训练得到的表项没有天然的 point-in-time 语义;更新知识、撤销错误和审计来源,仍是应用层必须解决的事情。

对照最值得追问的是资源口径:等 FLOPs 不等于等墙钟时间,CPU 内存带宽和批大小可能改变经济性。离线批量研究与低延迟事件处理,应分别测吞吐和尾部延迟,不能用一个平均加速数字代表两者。

编辑理解

带走一个判断

这篇论文值得高分,不是因为它宣布记忆能替代推理,而是因为它展示了两者可能互补,并认真问了“钱花在什么地方”。读完以后,应更警惕只有总参数增长、没有同预算对照的架构宣传。

核查记录

已核查正文方法、主要结果与限制;未独立复现

四种日期不混用
收录日来源网页日论文首次公开最新版本日
非 Quantocracy 补充待核2026-01-12待核
同预算架构对照:分数变化均为百分点
指标MoE-27BEngram-27B变化
BBH EM50.955.9+5.0
HumanEval Pass@137.840.8+3.0
MATH EM28.330.7+2.4
MMLU Accuracy57.460.4+3.0

原文位置:Table 1

推荐 87/100 · 问题 28/30 · 证据 26/30 · 方法 25/25 · 复现 8/15

同预算比较和架构消融具有较强方法价值;结论限于所测训练规模,完整预训练成本高,因此复现分保守。

原文 CC BY 4.0;本站为中文改写与独立评析

返回全年目录 ↑

AI / 研究补充 / 正文核查完成

金融 LLM 的第一道门槛:你的回测,究竟在测谁知道未来?

Evaluating LLMs in Finance Requires Explicit Bias Consideration

Yaxuan Kong、Hoyoung Lee、Yoontae Hwang、Alejandro Lopez-Lira 等

把“数字好不好”与“这个数字是否回答了正确的问题”分开。它不是再列一次回测常识,而是指出模型权重、搜索排名和解释文字也会污染金融实验。

2 分钟看懂

用今天的大模型回测过去,收益究竟来自方法,还是模型已经见过后来发生的事?

只把行情切成训练集和测试集还不够:模型权重、检索材料、股票池也可能携带未来信息。

编辑自设例子,非作者实验

自设例子:用当前模型读 2020 年财报。输入里没有 2021 年数据,不代表模型不认识这家公司后来的成败。时间隔离要覆盖工具和知识,而不只是 CSV。

  1. 明确当时的可用信息
  2. 检查模型与检索的时间边界
  3. 检查股票池与样本筛选
  4. 记录搜索和评估过程
关键结果与解释边界
核对项结果意味着什么
文献样本164 篇作者回顾的研究样本,不是 164 个已证实失效的策略。
提及前视偏差26.8%衡量文献是否讨论问题,不是其余论文一定存在泄漏。
提及幸存者偏差1.2%提醒报告缺口;不能据此计算真实违规发生率。

不能推出什么

文献审查和调查能够揭示盲点,不能替代逐个策略的实证诊断。

研究用途

把模型版本、资料日期和股票池时点一起写进实验日志。

详细讲解

编辑理解

先问这个数字有没有资格被叫作回测

一个语言模型用 2019 年财报预测公司后来的表现,样本文件可能完全合规,但模型权重可能已经读过这家公司的结局。对传统因子来说,封住数据时间通常是核心关卡;对 LLM 来说,这只封住了一扇门。

这篇论文的价值,在于把评估对象从“输入文件是否早于交易日”扩展到整个信息系统。模型、检索器、网页版本、股票池、输出解释和执行时延,每一层都可能改变实验到底在估计什么。

原文证据

作者究竟发现了多大的问题?先别把“未讨论”读成“已犯错”

作者回顾 2023–2025 年的 164 篇金融 LLM 会议论文:26.8% 提到前视偏差,1.2% 提到幸存者偏差;没有单一偏差被超过 28% 的论文讨论。论文将常见问题分为前视、幸存者、叙事、目标和成本五类,并提出结构有效性清单。

这是报告与评估惯例的调查,不是逐篇复现后测出的虚假 alpha 比例。问卷接触 112 人,但完成全部必答题的是 50 人;其中 74% 认为现成评估工具稀缺或不存在。不能把不同分母混用。

原文位置:§1,Figure 2,§4,Appendix A
原文证据

最容易漏掉的一条:旧网页不等于旧信息集

论文把前视信息拆成模型权重与外部上下文两条通道。标注知识截止日并不能保证之后的信息绝无进入;闭源模型后训练与系统配置也不透明。

外部检索同样不能只按发布日期过滤:网页可能事后改写但保留原日期,搜索排名也可能借用了后来形成的链接和关注度。作者要求使用可核查的历史快照,并记录提示、检索文档、工具输出与决策时间。

原文位置:§2.1,§3.1
编辑理解

把有效性清单改成研究评审真正能问的五个问题

第一,做出预测时有哪些可用信息?不仅要有数据日期,还要能重建文档版本和模型调用版本。把今天的搜索结果限制到旧日期,不能自动复原当时的信息发现过程。

第二,当时可以买哪些证券?使用当前股票池重放历史,会把未来的存活条件带进去。即使任务只是财报问答,也可能因样本只来自知名幸存公司而低估风险信息处理难度。

第三,解释真的由证据约束吗?交换公司名称、删去关键段落、加入矛盾证据之后,如果结论几乎不动,漂亮文字可能只是事后配文。

第四,不知道时会不会停止?覆盖率与条件准确率必须一起报;拒答一半问题得到的高准确率,不等于全自动系统同样可靠。

第五,信息变成仓位需要多久?一次离线调用的美元成本可以很小,但几十分钟的证据链可能让短期信号失效。成本不只是佣金,还包括从可见信息到可执行决策之间的时间。

编辑理解

清单能排除什么,又不能替你证明什么

它最适合当“拒绝不合格证据”的门槛,不适合当满分认证。通过时间、股票池和成本检查,仍可能有多重检验、标签重叠、暴露遗漏和参数选择偏差。反过来,一篇无法证明可交易 alpha 的论文,仍可能对抽取、检索或系统设计有价值,只是必须换一个更窄的主张。

因此推荐阅读分也不能等同于部署分:一篇严谨揭示失败机制的文章,往往比一条收益极高却无法核查的曲线更值得研究员花时间。

核查记录

已核查正文方法、主要结果与限制;未独立复现

四种日期不混用
收录日来源网页日论文首次公开最新版本日
非 Quantocracy 补充待核2026-02-15待核
推荐 90/100 · 问题 30/30 · 证据 24/30 · 方法 22/25 · 复现 14/15

可直接改进项目评审与数据审计;文献回顾和清单不是偏差大小的因果估计,不能凭检查表证明 alpha,因此证据分不满。

尚未执行的实验思路

为每个决策保存 as-of 时间、证券池版本、模型快照、原始文档哈希、检索结果与执行时间;分别设“证据被撤掉”与“公司名被匿名化”的对照。先看输出是否仍随可见证据变化,再讨论收益。 这是本站提出的审计方案,尚未执行。它的验收不是收益变高,而是研究结果能够被另一位研究员重建。

原文 CC BY 4.0;本站为中文改写与独立评析

返回全年目录 ↑

AI / 研究补充 / 正文核查完成

QuantaAlpha:会进化的因子研究员,还是更有效率的历史拟合器?

QuantaAlpha: An Evolutionary Framework for LLM-Driven Alpha Mining

Jun Han、Shuo Zhang、Wei Li、Zhi Yang、Yifan Dong 等

真正的新东西是让整段研究轨迹变异、交叉;真正该警惕的是把生成因子的研发过程留在样本外检验之外。

2 分钟看懂

让 AI 不断修改因子研究路径,能不能比反复换提示词找到更好的信号?

普通自动挖因子常重试同一种思路;这里把整条研究轨迹当作可以变异和交叉的对象。

编辑自设例子,非作者实验

自设例子:一个失败因子源自错误的经济解释,另一个来自不合理的计算窗口。只修代码不够;必须区分修改假设与修改实现。

  1. 提出因子假设
  2. 生成并约束代码
  3. 评价研究轨迹
  4. 变异 / 交叉后继续检验
关键结果与解释边界
核对项结果意味着什么
作者样本外年化27.75%论文的净超额收益口径,不是组合绝对年化收益。
最大回撤7.98%同属论文的超额曲线口径,不能与指数绝对回撤混比。
测试区间2022—2025训练 2016—2020、验证 2021;模型知识时间隔离仍需另外审查。

不能推出什么

更有效率的搜索也可能更有效率地拟合历史。必须记录搜索次数、失败路径及真实交易时点。

研究用途

先复核净超额定义与信号到成交的时间对齐,再考虑移植因子搜索流程。

详细讲解

编辑理解

有意思的不是让 AI 写公式,而是让它改自己的研究路线

普通因子生成器会改窗口、换算子、重新组合价量字段。更难的问题是:一个因子不好,究竟是经济假设、表达式、代码,还是评价方式出了错?如果每次都从头生成一遍,就没有把研究失败变成可复用经验。

读 QuantaAlpha,应该先看它如何定义“可继承的研究经验”,而不是先看收益排行。轨迹级搜索有机会减少重复踩坑,但也会把历史筛选结果积累得更充分;工程效率和统计可信度不天然同向。

原文证据

把作者结果压缩到同一口径

框架对完整研究轨迹做变异与交叉,并约束假设、公式、代码的一致性。CSI 300 股票样本:2016–2020 训练、2021 验证、2022–2025-12-26 测试。GPT-5.2 版本报告 IC 0.1501、ARR 27.75%、MDD 7.98%。附录定义后两者基于扣交易成本的超额序列,不是绝对净值。

策略用 50 只等权股,每次淘汰 5 只,次日开盘成交,买费 0.05%、卖费 0.15%;标签却是次日收盘到再下一日收盘的收益。

原文位置:§4–5,Table 1,Appendix A.1–A.2、B
编辑理解

为什么收益标签与成交时点的差别值得认真看

一个信号可以用收盘到收盘收益训练,再用于开盘交易,这本身不自动构成前视。但两者不是同一个目标:开盘价包含隔夜跳空,持仓可交易时点和预测标签覆盖的区间也不同。

研究员需要追踪的是“特征最后可见时间 → 输出信号 → 成交价格 → 实际持仓收益”。若这里无法逐步对齐,较高的 IC 可能没有等比例映射为可交易收益。不能把这个疑点直接写成作者用了未来数据,也不能因为使用了成熟回测框架就跳过审计。

编辑理解

轨迹进化的统计代价:你优化的不只有公式

假设两个搜索器最后都输出 20 个因子。甲只评估过 30 条候选,乙评估过 3,000 条,并反复调整生成提示。最终因子数一样,研究自由度却完全不同。只匹配最终库大小,不能公平比较研究系统。

一套有说服力的验证应冻结生成规则,让候选试验次数、可见验证区间、失败日志、累计计算资源都可比较;测试集只用于最后一次评估。变异和交叉如果依赖测试期表现,就已把所谓测试变成了训练搜索的反馈。

尤其不能把因子输入只含历史价量,误认为整个研究过程就满足历史可用性。后发模型可能通过对市场阶段和知名规律的知识影响候选选择。需要区分“公式在历史上能计算”与“当时的研究系统能生成并选择它”。

编辑理解

该抄的是研究日志,不是作者的最高收益参数

最值得迁移到团队内部的产物,是带谱系的候选库:每个因子记录原始假设、父因子、改动部位、代码验证、所有历史尝试,以及为什么被淘汰。它能让同事检查改进究竟来自机制,还是来自反复搜索。

把这篇与 Agentic Empirical Asset Pricing 配合阅读会更有效:前者让研究过程自动演化,后者促使我们问整个研究过程有没有被公平回测。两篇合起来提出的是一个研究治理问题,而不是两条可直接上线的策略。

核查记录

已核查正文方法、主要结果与限制;未独立复现

四种日期不混用
收录日来源网页日论文首次公开最新版本日
非 Quantocracy 补充待核2026-02-06待核
推荐 80/100 · 问题 29/30 · 证据 18/30 · 方法 23/25 · 复现 10/15

与 A 股个股因子研究高度相关,轨迹级搜索有启发;历史评估使用后发模型,完整生成日志与等搜索预算需独立审计,收益证据折价。

尚未执行的实验思路

使用同一可用个股样本、相同候选调用预算,把随机公式搜索、单轮 LLM 生成、轨迹进化三组放在同一个验证与封存测试流程。下游预测器、交易规则和成本保持一致,同时报告候选有效率、重复率、残差 IC、净超额以及所有失败试验。 窗口长度按实际样本和标签决定,不默认长期滚动。先证明“同样的研究预算能更稳定地产生增量”,再扩大投入。方案尚未运行。

arXiv 非独占许可;本站仅提供有限事实摘要与独立评论

返回全年目录 ↑

AI / 研究补充 / 正文核查完成

FinSheet-Bench:82.4% 的表格问答准确率,离放心交付还差什么?

FinSheet-Bench: From Simple Lookups to Complex Reasoning, Where LLMs Break on Financial Spreadsheets

Jan Ravnik、Matjaž Ličen、Felix Bührmann、Bithiah Yuan、Felix Stinson、Tanvi Singh

比模型排名更重要的是评分规则:数字允许误差,列表可能忽略顺序。一个“答对了”的答案,未必足以通过真实财务表的验收。

2 分钟看懂

模型能答对财务表里的问题,是否就可以放心把 Excel 交给它?

单个金额查找与跨基金、跨日期合并计算不是同一难度。小表的分数可能掩盖大表的失误。

编辑自设例子,非作者实验

自设例子:从一张表读出基金 A 的 NAV 很容易;问八只基金所有项目的现金流并按 IRR 排序,就同时要求识别实体、算数和排序。

  1. 把合成基金表序列化为文本
  2. 按固定模板生成问题
  3. 让模型回答
  4. 规则与模型裁判共同评分
关键结果与解释边界
核对项结果意味着什么
最高总体分82.4%特定题库和评估规则下的成绩,不是任意 Excel 任务成功率。
大文件表现48.6%152 家公司、8 只基金的大文件平均表现显著更低。
数据形式24 个文件来自 8 套合成基金表的变体,不是 24 个真实基金样本。

不能推出什么

模型读的是序列化文本,不是操作原生 Excel;宽松匹配和裁判规则会影响分数。

研究用途

验收财务助手应分别测字段、单位、公式、排序和大文件,不要只看总体均分。

详细讲解

编辑理解

你不是需要一份“看起来对”的表,而是需要每个数字能追回去

给模型一张持仓或基金明细,问“未退出项目的投入资本是多少”,表面上是加法,真正难处却可能在加法之前:哪些行属于哪个基金,括号是不是负数,币种是否统一,合并表头修饰的是哪一列。

因此,单看模型会不会算,往往找错了瓶颈。FinSheet-Bench 的价值是把这些接近工作现场的复杂性纳入测试;它的局限也来自同一处——输入和评分怎样设计,决定结果能否映射回真正的电子表格任务。

原文证据

这不是让 Agent 自由操作 Excel 的测试

作者构造私募股权基金风格的合成数据,8 份基础表各有 A/B/C 结构版本,共 24 个评估文件。16 类问题模板覆盖查找、计数、排序、筛选、汇总与多步骤计算;每个模型大约回答 500 个问题。

工作簿统一序列化成 CSV 风格文本,工作表由标题分隔。模型看到整份文本后一次回答,不是拥有原生 Excel 对象和计算工具的 Agent。标准答案来自人工规整后的表,由 Python 确定性函数计算。

原文位置:§3.1、§4.2–4.4
原文证据

排名看似接近,失败却有明显结构

整体最佳 Gemini 3.1 Pro 为 82.4%,GPT-5.2 reasoning 为 80.4%,Claude Opus 4.6 thinking 为 80.2%。最大的文件含 152 家公司、8 个基金,全模型平均仅 48.6%;最容易文件平均 86.2%。

这个差异说明文件复杂度可能比领先模型之间约 2 个百分点的差距更值得关注。GPT-3.5 因上下文溢出只能覆盖部分文件,必须区分它在可处理问题上的准确率与覆盖所有问题的有效准确率。

原文位置:Table 4,Table 8,§5
原文证据

真正值得研究员停下来的地方:准确率的判定器

评分分三层:规则精确匹配、更宽松匹配、LLM 裁判。数值第一层允许 2.5% 相对误差,第二层允许 5%;列表按集合比较,第一层 Jaccard 门槛 0.95,第二层 0.75,并不保留顺序和重复。

约 48% 答案进入模型裁判。作者用两个裁判独立检查这部分答案,意见不一致的 161 项再人工审阅。但两个裁判的一致性不是对全部答案的独立真值认证。

原文位置:§4.3.1,Table 3
编辑理解

排序题按集合打分,会发生什么?

用一个独立例子就能看清:要求按 EBITDA 从高到低列出甲、乙、丙,答案却给丙、乙、甲。若只核集合,两份答案完全相同;排序这项能力却没有被验证。

这并不意味着论文的所有排序答案都有这个错误,而是其公开的无序判定规则无法单独支持排序完全正确的主张。同样,允许数值误差可以缓解输出精度差异,但 5% 的估值误差和 5% 的格式舍入误差不是一回事。

因此不应将 82.4% 当作严格字段级全对率,也不能从论文直接推出“任何模型工具系统都无法处理财务表”。它检验的是特定文本输入与回答配置,不是经过解析、执行代码、校验和人工审核的完整生产链。

编辑理解

真正的落地指标:一份报告需要多少分钟复核

如果一个系统把 100 个答案中的 82 个答对,却无法告诉你错在哪里,研究员仍可能需要重算全部 100 个。平均准确率提高并不保证审核工时同比下降。

更有价值的接口应该同时交付原始单元格位置、字段映射、过滤条件、计算表达式和汇总校验。对于数值提取,算术交给确定性代码;对于无法消除的表头歧义,明确留待复核。这样才能把错误定位变成可管理的工作量。

核查记录

已核查正文方法、主要结果与限制;未独立复现

四种日期不混用
收录日来源网页日论文首次公开最新版本日
非 Quantocracy 补充待核2026-03-07待核
推荐 83/100 · 问题 28/30 · 证据 23/30 · 方法 21/25 · 复现 11/15

输入形式和评分规则披露充分,直接对应投研表格工作;样本为合成数据,且容错评分与真实交付要求存在距离,未证明工具增强系统上限。

尚未执行的实验思路

建一个不含敏感数据的小型金标准:同一批数值保留原始排版、规整表格两种输入,分别测试直接问答与解析后代码计算。固定模型和预算,按字段绑定错误、算术错误、遗漏和排序错误分类,再报告整表全对率与人工复核分钟数。 这是本站的实验建议,尚未运行。它比只换最强模型更能定位你的瓶颈究竟在“理解表”还是“算对数”。

原文 CC BY 4.0;本站为中文改写与独立评析

返回全年目录 ↑

AI / 研究补充 / 正文核查完成

FinSTaR:78.9% 的“金融推理准确率”,不是 78.9% 的涨跌预测胜率

FinSTaR: Towards Financial Reasoning with Time Series Reasoning Models

Seunghan Lee、Jun Seo、Jaehoon Lee 等

把能由历史数据算出的状态,与真正未知的未来分开。这项设计值得借鉴;将两类题混在一起的平均分,却很容易产生夸大的投资想象。

2 分钟看懂

“金融推理准确率”究竟混合了哪些任务?

解释已发生的财务事实与预测未来表现需要不同证据,把它们混成一个分数会误导读者。

编辑自设例子,非作者实验

自设例子:“利润率是否上升”可以查表核验;“这只股票会不会跑赢”必须面对未来不确定性。它们不能使用同一种成功标准。

  1. 区分评估任务与预测任务
  2. 生成适配任务的推理过程
  3. 分别检验子任务
  4. 再看总体分是否掩盖短板
关键结果与解释边界
核对项结果意味着什么
总体分78.9%多个任务聚合的得分,不是股票涨跌胜率。
评估 / 预测95.0 / 68.2事后事实判断明显比预测任务容易。
相对表现预测51.5%这个子项远弱于总体分,不能用总体分替它背书。

不能推出什么

样本筛选与类别平衡影响可迁移性。预测评价不等于可交易、扣费后的投资回报。

研究用途

读投资 AI 论文时先拆任务和标签,再看总分。

详细讲解

编辑理解

金融推理里,混着两种完全不同的难题

“目前回撤多深”和“接下来会不会修复”看似都在分析行情,实际上前者是对已知数据的计算,后者是对未知结果的预测。把两者用一个准确率汇总,会使模型的算术进步看起来像预测能力进步。

FinSTaR 值得读的起点,正是承认这两种任务不应共用同一套推理训练逻辑。量化研究员不必被术语吸引,先问每道题的答案在信息集里是否已被确定。

原文证据

方法与结果,只保留影响解释的几项

作者按单股/多股、状态评估/未来预测划分十项任务。状态题用程序生成计算推理链,预测题用情景推理链。Test A 总准确率 78.9%,其中评估均值 95.0%,预测均值 68.2%;相对表现题为 51.5%。这些不是交易胜率。

股票池取 2024 年 1 月市值前 250 的标普股,200 只训练、50 只留出;时间训练为 2010–2022,时间外测试为 2023–2025。分类通过下采样平衡。

原文位置:§3–4,Tables 3、5、10
编辑理解

总分怎样把结论推远了

这里的关键不是否认 78.9%,而是拒绝替这个数换含义。多分类题和二分类题的随机命中率不同;可直接计算的状态题和有噪声的未来题难度不同;不同题型也不对应相同的经济收益。

即便未来分类命中率更高,也还需要置信度、基准频率、样本覆盖和盈亏幅度。收益不对称时,高命中率可以亏钱;低命中率也可能赚钱。论文的标签准确率不能不经仓位规则就变成策略回报。

尤其对相对表现任务,更应该独立看其结果,而不是借状态题的高分抬高对选股能力的预期。

编辑理解

股票与时间两轴留出,是好开始,但仍有第三个时间问题

把证券和时间同时留出,比随机拆分更接近检验泛化。然而如果先按某个未来时点的市值排名挑选历史股票,训练世界就已经偏向后来变得重要、且能够存活到筛选时点的公司。

这不必然推翻论文在该固定宇宙中的分类比较,但它阻止我们把结果直接外推到当时真实可投的全市场。另外,历史价格文件的时间划分与基础模型权重的信息边界是两件事。它们需要分别核查,不能用一个 train/test 表格替代全部审计。

编辑理解

对量化团队最实用的迁移:让状态估计与概率预测分工

目前波动、回撤、相关性等定义清楚的量应由程序精确计算,模型负责解释计算口径与异常;未来题则输出经过校准的概率与条件,避免把一种可能情景写成确定结论。

两者的验收也应该分开。状态层看字段和公式是否正确,预测层看相对朴素基线的增量、时间外稳定性、概率校准以及成本后效用。用一个“金融理解总分”管理两层,只会让真实短板被平均数掩盖。

核查记录

已核查正文方法、主要结果与限制;未独立复现

四种日期不混用
收录日来源网页日论文首次公开最新版本日
非 Quantocracy 补充待核2026-05-05待核
推荐 75/100 · 问题 26/30 · 证据 19/30 · 方法 22/25 · 复现 8/15

评估与预测分开有方法价值;固定事后股票池、均衡分类样本和混合总分限制投资解释,代码材料完整性未核实。

原文 CC BY-NC-ND 4.0;本站仅提供有限事实摘要与独立评论

返回全年目录 ↑

AI / 研究补充 / 正文核查完成

TimeRLM:别把十万条数据塞进提示词,让模型回到数据里找证据

TimeRLM: Recursive Language Models Enable Precise Anomaly Localization in Long-Context Time-Series

Nicolas Zumarraga、Lorenzo Steno、Ning Wang 等

长上下文的另一条路不是继续扩窗口,而是把原始序列留在外面,用代码反复切片、计算、定位。它解决的是证据检索,不是未来收益预测。

2 分钟看懂

十万条时间序列太长,为什么非要一次全部塞进模型上下文?

直接给长文本或图像,模型可能看不全细节;这里保留外部数据,让模型按需写代码读取片段。

编辑自设例子,非作者实验

自设例子:怀疑某日成交量异常,先查全序列统计,再放大候选区间。更像研究员使用数据终端,而不是背下一整张表。

  1. 原始序列留在外部文件
  2. 模型提出数据查询
  3. 代码返回局部统计或片段
  4. 据此定位并回答
关键结果与解释边界
核对项结果意味着什么
异常区间重合度0.329 → 0.682GPT-5.5 对应图像基线与递归方案的 IoU;不是收益率或分类胜率。
文本方案0.677同类定位任务也接近图像递归方案,并非必须图像化。
数据长度16k—131k测试的序列长度范围,不能代表无限长数据都适用。

不能推出什么

读完整个序列后定位异常,和实时预警是两个问题。不能把事后定位包装成提前预测。

研究用途

适合研究数据检查与长序列诊断;上线预警必须单独做逐时点测试。

详细讲解

编辑理解

能说出“这里有异常”,与能指出异常在哪,不是同一能力

当一段很长的行情或系统日志只有几秒异常,压成摘要可能把关键证据丢掉;全部塞进上下文,又可能让模型在海量数值中漏看。真正要交付的是时间区间、通道和幅度,而不只是“波动加大”这样的描述。

TimeRLM 把问题从“模型能记住多少输入”改成“模型能否有效地查询输入”。这个转变对研究数据排错特别自然:人类研究员也不是一次读完所有 tick,而是先定位,再放大,再算数。

原文证据

实际操作链:原始数组不进提示词,查询结果才进

完整序列在沙箱里作为可访问的数据,模型可执行 Python,收到输出后再决定下一步。文本变体只读计算输出;图像变体还能绘图;另一配置允许对子区间发起子模型查询。

AnomalyXL 合成基准覆盖 16k–131k 个点、最多 16 个通道,任务包括定位、带证据分类、幅度、多通道定位和领先滞后。回答需要结构化结果,按真实注入位置等可验证目标评分。

原文位置:§3.1–3.2,Appendix E
原文证据

关键增量来自交互,不只是看图

Table 1 的 GPT-5.5 图像配置:单次读取的定位 IoU 为 0.329,TimeRLM 为 0.682;幅度得分却只从 0.440 到 0.480。递归文本与图像的定位结果分别为 0.677、0.682,差距很小,图像配置平均多用 3.1 轮。

摘要中带证据分类的 0.745 来自允许子模型查询的配置;基础图像 TimeRLM 在表中为 0.693。不能把不同配置最好的数字拼成一套同时实现的系统。

同骨干 GPT-5.5 的定位与幅度表现;不是收益指标
配置定位 IoU幅度得分
单次图像输入0.3290.440
TimeRLM 图像0.6820.480
TimeRLM 文本0.6770.496
原文位置:Table 1;§5
编辑理解

IoU 高,意味着什么?

假设真实异常在第 100 到 120 秒,系统报第 110 到 130 秒。按连续区间长度算,交集 10 秒、并集 30 秒,IoU 是 1/3。这比只回答“有异常”更严格,因为它要求证据边界。

但 IoU 没有告诉你异常是否可交易,也没有告诉你模型在第 110 秒已经能够判断。回看整条序列能定位异常,和异常发生时实时发出信号,信息条件完全不同。

因此这篇最自然的量化用途是历史数据质量检查、模型失效区间定位和交易日志诊断。若要做在线预警,需要把每次查询截断到当时已观测的序列,并另报检测延迟。

编辑理解

为什么不能省掉传统算法基线

对于孤立尖峰、缺失段或波动台阶,简单的稳健统计和变点检测可能又快又准。LLM 的潜在增量应在需要理解任务、选择分析工具、跨通道取证的复杂场景体现。

所以不能用弱单次输入模型代表所有传统方法,也不能把多轮工具系统的表现归因于某个语言骨干单独变聪明。公平的工程问题应是:同样墙钟时间和可用工具,交互控制带来了多少额外正确定位,代价又是多少。

核查记录

已核查正文方法、主要结果与限制;未独立复现

四种日期不混用
收录日来源网页日论文首次公开最新版本日
非 Quantocracy 补充待核2026-08-04待核
同骨干 GPT-5.5 的定位与幅度表现;不是收益指标
配置定位 IoU幅度得分
单次图像输入0.3290.440
TimeRLM 图像0.6820.480
TimeRLM 文本0.6770.496

原文位置:Table 1;§5

推荐 86/100 · 问题 26/30 · 证据 24/30 · 方法 24/25 · 复现 12/15

有明确定位指标、同骨干对照及工具实现;主要基准为合成异常,真实域验证不是金融交易,应用外推需折价。

尚未执行的实验思路

从本地脱敏时间序列构造已知错误:复权断点、时间戳错位、连续缺失、孤立尖峰。保留未注入异常的负样本,对比规则检查、变点模型与工具型 LLM;同时报告误报、定位 IoU、发现延迟、运行成本与证据日志。 不要只在“肯定有异常”的题里比较定位能力,否则会高估真实数据清洗中的价值。这是本站建议,尚未运行。

原文 CC BY 4.0;本站为中文改写与独立评析

返回全年目录 ↑

AI / 研究补充 / 正文核查完成

回测研究流程,而不只回测最后一条因子

Agentic Empirical Asset Pricing: Methodological Foundations

Yingjian Pan、Xiaowei Ding、Kay Giesecke

研究对象是“会反复找因子的系统”。关键不只是 0.96 的 Sharpe,而是它是否在公平预算、固定历史信息和真正封存的测试下仍有增量。

2 分钟看懂

自动研究代理最后交出一个好因子,怎样知道不是它试了太多次碰巧撞上?

只回测最终因子会隐藏中间失败尝试。论文把规划、编码、检查和失败记忆一起放进评估。

编辑自设例子,非作者实验

自设例子:两个助手各交一个因子,一个只试 5 次,另一个试了 5,000 次。最终 Sharpe 相同,并不表示证据同样强。

  1. 规划因子研究
  2. 生成代码并执行检查
  3. 按统计门槛筛选
  4. 记录失败并进入下一轮
关键结果与解释边界
核对项结果意味着什么
联合模型滚动 Sharpe0.96 ± 0.04在论文指定设置中,原始特征与新因子联合模型的结果。
静态对照 / 原始特征0.71 / 0.62同组对照有改进,但不能混入另一张单因子实验表。
重复次数3 次有重复实验,但不足以把与 0.91、0.90 的差距直接判成稳定优势。

不能推出什么

结果是作者设置的毛收益口径;历史数据回测也没有自动解决当前模型的知识泄漏。

研究用途

值得移植的是研究日志和预算约束,而不是只复制最终因子。

详细讲解

编辑理解

一条曲线究竟是在检验因子,还是检验研究员

想象两个研究流程。甲在今天反复看过全部历史,最后挑出一个公式,再画出它过去几年的漂亮曲线。乙事先锁定研究规则,在每个历史截止点只能接触当时数据,从提出想法到筛选都重新运行,再评价随后没看过的时期。

甲能说明被挑中的公式适合这段历史;乙才开始回答“这个研究流程在不知道未来时会不会选中有效公式”。给公式留测试集仍然必要,但如果研究者看过测试结果后改了提示、筛选门槛或生成规则,整个研究流程就已把测试集当成开发集。这是阅读自动因子发现论文时应先检查的地方。

原文证据

作者系统的骨架与关键比较

SEADS 将规划、公式生成、执行检查、统计筛选和研究记忆分开;不仅保存通过的因子,也记录失败。滚动比较把发现因子与原始约 400 个特征联合建模,检验增量,而不是单独展示新因子组合。毛 Sharpe:滚动 SEADS 为 0.96±0.04,静态库 0.71±0.05,原始特征 0.62;前两项为三次重复的均值±SE。0.96 与其他领先系统的差异并不可靠显著。

原文位置:§3.3–3.5,§5.2,Figure 2
编辑理解

用一个虚构因子走完流程,才能看懂各模块在防什么

以下是我的教学例子,不是作者发布的公式。假设 AI 提出“现金回款质量高、近期涨幅又不过热的公司,下一期表现可能更好”,写成两种横截面排名的乘积。第一关不是收益,而是逻辑:变量的报告期和实际公告日是否一致?收入为零或负数时,比值怎么定义?停牌股票是不是被错误当成收益为零?

第二关是实现:代码真的是现金回款,而不是因为字段名相近取到了现金余额吗?经济故事写得好,不能替代逐行核对公式。第三关才是统计:这个分数与下期个股收益有无稳定联系?方向是否反复变化?

第四关是增量:它会不会只是低估值、低波动或质量因子的重新命名?第五关是组合:即使有新信息,若它只出现在很难成交的股票,或者每月换手过高,也未必能变成净收益。把这些关卡拆开,失败才有可诊断的含义;只有一个综合评分时,代码错误、重复信号和真实无效容易被混在一起。

编辑理解

新颖性与有效性为什么必须分开量

设已有因子为 x,新公式是 2x+3。表达式长得不同,但排序完全相同:公式文本的新颖不等于投资信息的新颖。再设新公式是随机数 u,它与 x 几乎不相关,却没有预测价值。仅以低相关性奖励“创新”,会奖励噪声。

更细的一种情况是 z=x+y:它对单独 x 或单独 y 的相关性不一定极高,但依然可能完全落在现有因子的线性组合里。因此,除了两两相关,还要问“控制已有信息后剩下的部分有没有用”。在研究上可以做残差化或联合模型比较,在投资上还应检查组合风险暴露。

这也是我不愿仅凭新增因子的 Sharpe 排名给系统定胜负的原因。发现很多相似信号,可能只是扩大了同一种风格押注;发现很少但互补的信号,也可能更有价值。数量、增量和净效用是不同目标。

编辑理解

0.96 与 0.71 能回答什么,不能回答什么

静态库对照比单纯比较“AI 与非 AI”更有意思:如果初始库相同,后续组合重估规则也相同,重新发现因子的系统更好,就给“持续研究值得做”提供证据。但它仍然要匹配实际计算预算,并确保刷新流程没有反复看到未来。

0.96−0.71=0.25 是 Sharpe 数值之差,不是多赚 25%,也不是年化收益提高 25 个百分点。0.96±0.04 里的 SE 是少量重复运行间均值的不确定性,不能覆盖样本期选择、费用估计、未来市场结构变化等所有风险。

还有一个极易误读的比较:原始特征上加新因子的联合模型,与仅用通过筛选因子的模型,不是同一个投资组合。两张图的数值不同不一定矛盾,但不能抽出各自最高数字拼成“全方位优胜”。这里应优先读比较对象,而不是曲线终点。

原文位置:Figure 2 图注,§5.2
编辑理解

这篇的价值与我仍不放心的地方

我认同把研究过程纳入测试的方向,但不会把“当时可用数据”误写成“完全当时可用信息”。今天的大模型可能已经见过过去行情与学术研究;把它放到历史截止点,输入端封锁未来也未必抹掉参数里的知识。对后续全新时期做真正前瞻记录,才是更强的补充证据。

另一个问题是预算。两个系统都提出 300 个候选,不代表调用次数、输入长度、修改次数与人工调试相同。更严格的比较应按研究费用或总调用预算画出性能曲线,而不是只有一个固定候选数终点。

我最愿意带走的是失败日志和嵌套测试纪律,而不是“加一个 agent 就会获得新 alpha”。若一个便宜的随机表达式搜索在相同预算下表现相当,复杂系统就需要重新证明自己的价值。

核查记录

已核查正文方法、主要结果与限制;未执行代码

四种日期不混用
收录日来源网页日论文首次公开最新版本日
非 Quantocracy 补充待核2026-09-01待核
作者滚动实验,Panel A,毛 Sharpe;不是独立复现
方案平均 Sharpe口径
SEADS 滚动发现0.96 ± 0.043 次重复的均值 ± SE
SEADS 静态库0.71 ± 0.05同一初始库,不重新发现
原始特征基线0.62无 LLM 发现环节

原文位置:§5.2 / Figure 2

推荐 87/100 · 问题 30/30 · 证据 23/30 · 方法 24/25 · 复现 10/15

评估完整研究过程而非仅评估赢家因子,方法价值高;三次重复与毛收益限制证据力度,完整独立复现尚未完成。

尚未执行的实验思路

先限定为个股横截面,不混入指数择时。检查实际有多少连续月份、多少独立市场阶段,再决定能承受几次重新发现;不在这里机械套用 10 年、20 年,也不把某个固定短窗口当成已经最优的答案。 最小试验只回答:在同一可投资个股池、同一数据截止日、同一费用预算下,AI 候选是否比固定因子及随机表达式提供增量?冻结最后一段数据,开发期内做选择,测试期只评价一次。训练期用于提出与估计,验证期用于筛选,测试期不能再返还给生成器。 交付物应是候选总账、失败原因、最终公式、逐期个股持仓与交易,以及统一费用下的净表现。样本不足时,应降低结论强度,而不是扩大尝试次数后挑最好结果。

返回全年目录 ↑

AI / 研究补充 / 正文核查完成

同一份财报,换个角色就换了判断

The Analyst in the Prompt: Role, Retrieval, and Memory Biases in LLM Financial Analysis

Ahmed Asaad、Amr Mohamed、Yang Zhang、Omneya Abdelsalam

给模型“分析师人设”可能改变它对证据本身的评分;统一检索材料并不能消除这种影响。

2 分钟看懂

同一份财报、同一组证据,为什么换成看多或看空角色,结论就变了?

通常认为角色只是写作风格。作者通过固定检索证据,把“找到不同材料”和“对相同材料作不同解释”分开。

编辑自设例子,非作者实验

自设例子:同一段利润下滑说明,乐观角色强调暂时性投入,空头角色强调竞争恶化。证据没变,权重却变了。

  1. 对同一财报设置不同角色
  2. 先允许各自检索
  3. 再固定相同证据回答
  4. 拆出检索差异与解释差异
关键结果与解释边界
核对项结果意味着什么
财报样本3,575 份覆盖 2013—2024 年;不是同一公司的重复问答。
模型数量12 个结果不是只在单一模型上的个案。
固定证据后角色效应平均保留 69%指回归角色系数的保留比例,不是 69% 的回答都错误。

不能推出什么

作者展示的极端公司案例不是平均效果,不能把个案差值当全体样本结论。

研究用途

多角色评审应固定证据并统一评分准则;不同口吻不等于不同信息。

详细讲解

编辑理解

先把问题说准确:偏好可以改变建议,不该偷偷改变证据评分

假设一家公司同时披露利润增长和一笔重大或有负债。成长型投资者愿意承担风险,保守投资者不愿意,两人收到不同的投资建议完全合理。真正需要检查的是:系统能否先按一致标准描述材料,再单独讨论这份材料是否适合某个用户?

如果我们让模型“扮演做空分析师”,它不仅更强调风险,还把原本声称中性的证据评分调低,那么用户看到的就不再只是偏好适配。人设已经参与了证据解释。本文的研究对象是这种边界失守,而不是证明某种投资风格错误,也不是测试谁最会预测股价。

这比“提示词会影响回答”多走了一步:作者尝试拆开影响发生的位置。是模型搜到的材料变了,还是同样材料被读成了不同意思?这两种问题对应完全不同的修复方法。

原文证据

实验台:同一份文件、两个评分、三种提示条件

样本为 2013—2024 年的 3,575 份 SEC 10-K/10-Q,来自样本期内曾为标普 500 成分的公司;每家公司最多六份文件。抽取管理层讨论、风险因素等叙述部分,而不是把整份财报所有表格交给模型。12 个模型都返回相同 JSON,包含 EvidenceScore 与 PersonalizedScore,范围都是 −1 至 +1。前者要求中性,后者允许体现用户偏好。

检索将文本切成约 400 token 的片段,相邻重叠 80 token,使用 text-embedding-3-large,取前 8 个片段。生成温度为 0、top-p 为 1、输出上限 1,024 token。九种投资角色另加中性基准;记忆条件使用五组匹配用户画像。这里的“记忆”是放入提示的用户背景,不是对真正长期对话记忆系统的完整测试。

三组实验究竟改了什么(依据 §3.2 重组)
条件检索材料生成时的身份与偏好
PR角色参与检索查询;材料可能不同助手扮演投资角色
NR每份文件先做中性检索;所有角色收到逐字相同材料仍让助手扮演投资角色
MEM沿用 NR 同一份材料助手保持中性;偏好改写成第三人称用户画像
原文位置:§3.1–3.3
编辑理解

为什么这个对照有辨识力,又不能证明什么

PR 对比 NR,主要排查“看到了不同证据”。如果换成完全相同材料以后差异消失,问题就在检索;如果差异仍在,就必须检查生成与解释阶段。这里必须固定片段内容、顺序和截断方式,仅说“来自同一份年报”是不够的。

NR 对比 MEM,则把“你是一个什么样的分析师”改为“你服务的用户有什么偏好”。前者容易被模型当成自己的判断立场,后者更像需要单独满足的客户约束。这是一个可检验的机制解释,不是“所有人设提示都不能用”的禁令。

但三组之差不是纯粹的心理机制因果分解。角色措辞、中性助手声明和用户画像表述并非只有一个字符不同;缩小的效应不能全部归功于某个词的位置。可以把实验看成两套实际提示方案的对比,不能把其中的比例命名为大模型内部认知偏差的精确构成。

原文证据

69% 到底怎么算:它的分母不是文件数量

作者先在每种模型、条件和评分字段上做文件固定效应回归:评分 = 文件固定效应 + 角色系数 + 误差。角色系数衡量相对于中性提示,同一文件的评分平均移动多少。统计推断按文件聚类,使用 1,000 次 bootstrap。

对某一角色,保留比例 Retain = |NR 角色系数| ÷ |PR 角色系数|。使用绝对值是因为做多、做空可能朝相反方向移动。正文的平均 69%、中位数 68%,汇总的是四组强信号匹配角色;第五组动量因基准效应接近零而没有进入头条汇总。12 个模型的汇总保留比例为 44%—89%。

原文位置:§3.4–3.5,Table 1
编辑理解

用一组假设数字把三个指标算一遍

以下数字是我为解释公式设置的教学例子,不是论文观测值。假设某角色在 PR 下相对中性评分移动 −0.20,在 NR 下移动 −0.14,在 MEM 的证据字段移动 −0.04,而个性化字段移动 −0.16。

保留比例是 0.14÷0.20=70%:固定证据后,原来的角色效应还剩七成。角色改成用户画像后的缩减比例是 1−0.04÷0.14≈71.4%:这是对 NR 的进一步缩减,分母不是最初的 0.20。MEM 泄漏比例则是 0.04÷(0.04+0.16)=20%:它比较两个输出字段承载的偏好效应,不是说 20% 的回答错误。

这三个百分比不能相加,也不能相互替换。尤其不能写成“固定检索解决了 30% 的幻觉”。实验没有把幻觉数出来,而是在测评分系数。还有一个陷阱:若 PR 系数仅为 0.001,NR 为 0.002,保留比例就是 200%,但绝对移动非常小。因此读比例时必须同时看绝对效应。

原文证据

同一公司怎样从偏多变偏空:可口可乐案例

附录选择可口可乐 2023 年 10 月 24 日提交的 10-Q,作为 PR 下做多与做空角色分歧最大的案例。文件同时包含 154 亿美元现金及相关流动资产、约 56 亿美元税务诉讼相关潜在税费负债等材料。PR 下,做多角色检索到的流动性片段排名第二;做空角色下它排第九,因此落在 top-8 之外。这里确实有材料选择差异。

换成 NR 后,双方拿到同样八段,包括流动性和税务风险,却仍给出 +0.20 与 −0.30 的证据评分。MEM 下相应证据评分收敛到 +0.20 与 +0.10。注意,这是作者挑出的极端案例,不能把它当作全体文件的典型平均。

可口可乐个案的 EvidenceScore;不是模型准确率,也不是股价预测
条件做多角色/成长型画像做空角色/下行保护画像两者差距
PR+0.60−0.601.20
NR+0.20−0.300.50
MEM+0.20+0.100.10
原文位置:Appendix D.14,Table 9
编辑理解

原文也有值得纠正的表述,不能照单全收

这个案例很有说服力,但附录紧接着的文字不够严谨:它算出固定证据后的差距是原差距的约 42%(0.50÷1.20),却又将角色解释称为这个文件分歧的“较大部分”。只按所列数字,移除的差距是 0.70,保留的差距是 0.50,前者才更大。这个个案能证明同证据下仍有明显分歧,不能凭这组算术证明保留部分占多数。

这不推翻全文平均保留 69% 的结果:个案与跨模型、跨角色的平均本来就不是同一个统计量。它提醒我们必须把“作者想说明什么”与“这张表实际支持什么”分开。

原文位置:Appendix D.14,Reading the table 第 (2) 点
原文证据

究竟哪个改动有效:不能只归功于分成两个输出框

做空角色与下行保护画像这一组,NR 到 MEM 的缩减幅度在不同模型上为 51%—87%,中位数 73%。12 个模型的平均泄漏比例都低于 0.5,但不为零;范围为 0.05—0.37。0.5 表示用户偏好效应在证据字段与个性化字段的绝对系数相等,并非错误率的一半。

作者还做了角色/用户画像与单/双输出的 2×2 消融。在两种输出格式下,画像表述的证据侧效应仍只有角色表述的 16%—39%。所以减弱偏差不只是把 JSON 拆成两个键带来的;角色如何表述本身也起作用。机制核查只覆盖部分模型,不应外推为所有模型的稳定规律。

原文位置:§4.2–4.3,Limitations
编辑理解

排名有效与评分不稳为什么可以同时成立

举一个自设例子:中性角色给三家公司 0.2、0.4、0.6,悲观角色给 −0.2、0.0、0.2。三家的优劣顺序完全没变,Spearman 排名相关为 1;但如果系统在评分大于 0 时才入选,入选数量就改变了。一个信号可以保留横截面排序信息,同时严重影响绝对阈值决策。

这意味着应用评估至少应分两层:若只取前 20%,检验排序与入选名单变化;若按评分决定买卖、仓位或风险预警,还要检验校准与阈值穿越。只看 Rank IC 无法保证绝对评分可靠,只看评分平均偏移也不能断言选股完全失效。

论文的后续收益相关性分析因此只能作为旁证。它没有自动解决预训练知识、财报发布日期对齐、同公司重复观察、交易费用以及真正前瞻测试的问题。不能从“角色内排序含信息”跳到“换个提示词就能做出可交易策略”。

原文位置:§4.6,Table 3,Limitations
编辑理解

我的证据评级:机制诊断值得借鉴,正确性与投资效益仍未证明

最扎实的部分是固定证据后的角色对比:它给出了清楚的可反驳条件。如果复测时同文、同模型、同预算下的差异小到与重复调用噪声相当,那么对那个模型和任务,角色解释渠道就不再是主要问题。

我最在意的三个缺口是:第一,中性评分没有外部金标准,稳定地判断错也会通过不变性测试;第二,证据评分是复杂判断,不是营业收入这样的客观字段,评分准则本身可能允许合理分歧;第三,历史公开财报可能进入模型预训练,本文不是一场干净的历史选股竞赛。

所以我会给出很窄但有用的阅读结论:不要把“人设更专业”当作“证据更准确”的替代指标;把角色敏感性加入模型验收,但不要用它代替事实正确性验收。

核查记录

已核查正文、表 1/3/9、附录 D.14 和限制说明;未执行作者代码

四种日期不混用
收录日来源网页日论文首次公开最新版本日
非 Quantocracy 补充待核2026-09-02待核
作者 Table 1 的四组角色汇总;三列衡量不同现象,不能互相替代
模型或汇总PR 平均绝对系数NR 保留比例MEM 泄漏比例
DeepSeek-V3.10.2076%0.11
gpt-oss-120b0.3082%0.34
Llama-3.3-70B0.2574%0.05
Llama-3.1-8B0.4072%0.29
12 模型平均0.2069%0.19

原文位置:Table 1;展示部分模型与全体平均

三组实验究竟改了什么(依据 §3.2 重组)
条件检索材料生成时的身份与偏好
PR角色参与检索查询;材料可能不同助手扮演投资角色
NR每份文件先做中性检索;所有角色收到逐字相同材料仍让助手扮演投资角色
MEM沿用 NR 同一份材料助手保持中性;偏好改写成第三人称用户画像

原文位置:§3.1–3.3

可口可乐个案的 EvidenceScore;不是模型准确率,也不是股价预测
条件做多角色/成长型画像做空角色/下行保护画像两者差距
PR+0.60−0.601.20
NR+0.20−0.300.50
MEM+0.20+0.100.10

原文位置:Appendix D.14,Table 9

推荐 91/100 · 问题 29/30 · 证据 27/30 · 方法 23/25 · 复现 12/15

固定证据的对照、角色/记忆与输出通道消融较完整;不能由评分偏移直接推出投资损失,复现仍需多模型调用成本。

尚未执行的实验思路

优先做提示与输出结构的审计,不先回测股票。用一份冻结的公开中文报告片段集,分别运行角色提示、中性助手加用户画像;每种条件都保留模型版本、完整输入、片段哈希和原始输出。在每个条件内部重复调用,估计系统本身的波动。 输出拆为三个层次:事实表(数值、单位、报告期、原句位置)、证据评价(统一书面评分准则)、用户适配(明确使用哪些偏好)。同一用户偏好只能在第三层改变效用权重,不能回写事实表。检验事实错误、证据分差、符号翻转与入选名单重合率,并按公司聚类,而不是把同一家公司的多份报告当作完全独立样本。 通过标准应先由使用场景确定:例如硬事实的角色差异应为零;判断分差的容忍度应根据评分刻度和重复噪声制定。这里没有先拍一个看似科学的通用阈值,也没有宣称实验已经跑过。

CC BY 4.0;以下为中文改写、重组与独立评论,非作者原文

返回全年目录 ↑

AI / 研究补充 / 正文核查完成

让模型分清多层表头与数据的归属

H2Table: Hierarchical Hypergraph-Enhanced Large Language Models for Complex Table Reasoning

Jia Ling、Yangfan Wang、Chen Tang、Haoming Tan、Yang Yang、Yi Guan、Jingchi Jiang

遇到财报多层表头,先保留“这个数字属于哪一层”,可能比单纯增大模型更值得尝试。

2 分钟看懂

表头套着表头时,模型能否分清“这个数字到底属于谁”?

把多层表格拍平成文本,容易丢掉年份、业务和地区之间的归属关系。

编辑自设例子,非作者实验

自设例子:表头依次为“2025 年 → 国内业务 → 收入”。只保存最近的“收入”二字,就可能把海外值或上一年值拿错。

  1. 保留多层表头结构
  2. 把层级关系编码为超图
  3. 结合结构学习表示
  4. 按完整归属回答表格问题
关键结果与解释边界
核对项结果意味着什么
深层表头任务62.86 → 71.43TAMO 四层表头上改善 8.57 个百分点。
浅层表头任务71.43 → 68.57一层表头反而下降,不能概括为所有表都更好。
平均分71.86 → 74.15平均改善需要与不同结构层级的结果一起看。

不能推出什么

效果取决于表结构复杂度;引入更复杂编码不是无条件占优。

研究用途

财务表处理先保留单位、表头路径与合并单元格,再谈模型推理。

详细讲解

编辑理解

模型算错之前,可能已经拿错了数

读财报表格时,真正麻烦的常常不是乘除法,而是一个数字同时属于哪个业务、地区、报告期和单位。如果数据提取后只剩一串列名与数字,模型可能计算得很准确,却在计算错误的对象。

下面用一个自设例子说明:营业收入分国内、海外,每个地区各有 2024 年和 2025 年。海外分别为 100、120,国内分别为 200、210。问题是“海外收入同比”。正确答案为 120÷100−1=20%。若错把国内 2024 年的 200 当分母,就得到 −40%。这不是推理步数不够,而是地址选错了。

原文证据

论文做的结构改动

H2Table 把单元格作为节点、表头作为超边,并保留父子表头。编码时依次让单元格汇入叶表头、子表头汇入父表头、父表头向下传递、表头回传单元格;可学习查询向量将图表示压缩成结构提示,与表格文本一起送入经 LoRA 调整的 LLM。它不是扫描 PDF 的 OCR 系统。

原文位置:§3,Figure 2
编辑理解

超图并不神秘:先把这个数字的完整地址保住

在上面的自设表格中,数字 120 的完整地址应是“营业收入/海外/2025 年”,而不是孤零零的“2025 年”。同一个年份可以出现在很多业务分支下;父节点决定子节点到底是什么意思。

普通的两两连线擅长表达 A 与 B 有关系;一张表头统辖很多单元格时,更自然的表达是一个集合。如果再把多层表头压成一层,虽然还知道很多节点彼此相关,却弱化了谁包含谁、谁与谁是同级的区别。

从机制上看,向上汇总让高层知道子项的内容,向下传播让局部带回全局语境。这里的“汇总”是可学习向量的信息融合,不是把收入数值做算术相加。读者不应误以为经过图网络后,财务勾稽关系就自动得到严格保证。

编辑理解

为什么还需要结构提示,而不是把图直接塞给模型

语言模型最终接收的是它能处理的输入表示。一个大型表格如果把每个节点和每条关系全展开,输入长度可能很快变得昂贵。结构压缩的作用,是用有限容量传递对任务有用的关系。

可以把它理解为两份并行材料:文字表格给原始内容,结构表示提醒模型如何组织这些内容。它不是把原文换成一个神奇摘要,也不是一种免费的压缩。容量有限时,稀有但关键的表格细节仍可能被忽略;因此最后仍要检查答案引用了哪些单元格,而不只是看生成文字流畅不流畅。

原文证据

看同一模型内的增量,不要先看跨模型冠军

HiTab 上,同为 Llama3.1-8B、LoRA:四层表头准确率由 TAMO 的 62.86% 到 H2Table 的 71.43%;一层则由 71.43% 降至 68.57%。各深度算术平均为 71.86% 与 74.15%。这些结果不支持“每种深度都改善”。

原文位置:Table 1
编辑理解

把提升算清楚,并辨认平均值隐藏了什么

四层表头的增量是 8.57 个百分点;相对 TAMO 的提高约为 13.6%,两种说法分母不同。各深度平均提高 2.29 个百分点,也不等于整份测试集中随机抽一道题的正确率提高 2.29 个百分点:宏平均给每个深度相同权重,而题目数量可能不同。

一层上的退步尤其有价值。它提示改进可能是有针对性的结构偏置,而非无条件提升语言能力。若实际工作中绝大多数是简单表,复杂度收益可能不足以抵消训练、解析和维护成本。

更公平的阅读顺序是:先看同一基础模型、同等训练条件下更换表示的差异;再看不同数据分布;最后才看小模型与大模型的跨组比较。训练过的专用小模型胜过零样本大模型,不等于它在任意财报工作流里都更强。

编辑理解

我认为论文之外还缺一个廉价但很强的对手

回到教学表格,把每个数明确写成“业务=海外;指标=营业收入;期间=2025 年;单位=亿元;值=120”,再要求模型只负责选择字段、计算器负责算术。这种完整路径展开没有学习型图编码,却保留了语义地址。

如果它已经解决绝大多数错误,图模型的必要性就较弱;如果图方法在相同预算下,面对更深表头、同名列和跨层比较仍有明显优势,额外复杂度才更值得投入。这不是声称路径展开一定赢,而是要求新方法战胜与痛点直接相关的基线。

另一个风险在上游:如果 PDF 解析阶段把“海外”挂到了错误父表头,再强的层级编码也可能忠实地学习错误结构。评价应同时包含“给正确结构”和“从真实 PDF 起步”两种条件,把结构推理能力与解析可靠性分开。

核查记录

已核查方法、主表和实验设置;未训练模型

四种日期不混用
收录日来源网页日论文首次公开最新版本日
非 Quantocracy 补充待核2026-09-01待核
HiTab / Llama3.1-8B,同为 LoRA;准确率百分比
表头层数TAMOH2Table
一层71.4368.57
四层62.8671.43
各深度算术平均71.8674.15

原文位置:Table 1

推荐 81/100 · 问题 25/30 · 证据 23/30 · 方法 22/25 · 复现 11/15

结构归属对财务表重要,深层表头对照清楚;部分浅层任务退步,训练与迁移成本需要另验。

尚未执行的实验思路

建立一套按整张表划分训练/测试的中文题集,避免同一表的近似问题泄漏。每题存正确单元格地址、原始数值、单位和计算表达式。 先比较原始表格文本、完整表头路径、路径加确定性计算三条链路,再决定是否投入 H2Table 训练。统计取数错误、父子归属错误、单位错误、算术错误,不能只有一个总准确率。如此即使最终不使用图网络,这篇论文仍能帮我们定位财报阅读的真正瓶颈。

返回全年目录 ↑

AI / 研究补充 / 正文核查完成

回答一个问题,如何找全分散在多篇材料里的证据

A Tree-based RAG Framework for Evidence-Intensive QA via Adaptive Planning and Topology-Aware Evidence Gathering

Songeun Lee、Kyungjin Min、Injae Na、Suyeong Lee、Chiyoung Kim、Woohwan Jung

研究类问答的难点常常不是读懂一篇文档,而是发现自己还缺哪部分材料。

2 分钟看懂

问一个跨多份材料的问题,模型怎样知道自己还漏了什么?

普通 RAG 像一次只拿几份材料给研究员:拿到的都相关,但相关不等于齐全。

编辑自设例子,非作者实验

自设投研例子:判断 A、B、C 三家公司收入改善主要来自提价还是销量。A 公司直接披露了量价;B 公司只给收入和销量,需要核对单位再算平均单价;C 公司没有销量,就应保留“证据不足”,不能用同行补上。这个例子用来解释流程,不是论文的金融实验。

  1. 列出需要回答的公司与问题
  2. 已有材料够 → 复用;问题简单 → 检索
  3. 仍然复杂 → 拆成更小问题
  4. 汇总子问题,并保留证据缺口
关键结果与解释边界
核对项结果意味着什么
证据召回31.68 → 50.79应找到的证据,确实找回更多;仍没有全部找齐。单位为百分点口径的召回分数。
回答 F146.64 → 50.84答案质量改善 4.20 个点。不是投资判断准确率,也不是收益率。
效率模块的代价104.59 秒 / 50.84 F1去掉聚类与横向复用,变为 183.95 秒 / 53.96 F1:完整版本更快,但不一定答得最好。

不能推出什么

这篇测的是通用多文档问答,不是财报量价分析。召回率与 F1 衡量不同环节,不能把两个增量当同一种准确率比较。

研究用途

对量化研究的用途是组织跨材料查证,不是直接预测股票。先看 Table 2,再看 Table 3 的速度—质量取舍。

详细讲解

编辑理解

先把问题说清:不是找到一篇相关材料,而是把该找的找齐

我们用一个问题贯穿这篇:A、B、C 三家公司本期收入都改善了,主要靠提价还是销量?这是编辑自设的投研例子,不是作者做过的金融实验。

只搜这句话,系统可能找回几篇行业景气文章,内容看上去很相关,却没有覆盖三家公司的量价数据。反过来,直接塞入三份年报,也不保证相关附注、历史口径和补充公告都在其中。

所以这篇研究处理的不是“模型能不能把话写顺”,而是:如何发现缺口,并决定下一份该找什么。

编辑理解

传统的一次检索,卡在了哪里

假设第一轮拿到了 A 公司的收入和销量,以及一篇行业价格新闻。模型现在确实有材料,但它没有 B、C 两家的证据。若直接开始总结,就可能把 A 的情况推广到所有公司。

把问题预先拆成 A、B、C 三个固定任务也还不够:B 可能需要继续核对收入口径,C 可能需要翻附注。每个分支的难度不一样,不能要求每家公司都只搜同样几次。

APT-RAG 的思路是:边做边决定下一步,而不是在一开始就把路线完全固定。

原文证据

到每一步,只作三个选择:复用、查找、继续拆

作者把总问题和子问题组织成树,按深度优先顺序交错进行规划与回答。到一个新问题时,先用之前完成的同层问题补全指代和约束。

第一种选择:已完成的问答足以回答当前问题,就复用已有证据。第二种选择:问题已足够简单,但还缺材料,就直接检索。第三种选择:问题依然复杂,就拆成更小的子问题;子问题完成后,再向上合成答案。

论文把这三条路叫横向、外部和纵向证据收集。名字不是重点:重点是已有答案可以被后面的任务利用,复杂分支可以继续展开。

原文位置:§3.2–3.4;Figure 2
编辑理解

把这三个选择放回我们的公司例子

A 公司直接披露量价贡献,找到对应表格即可回答。B 公司只披露收入与销量,需要继续追问单位、统计范围和是否包含新并表业务;确认口径后,才有资格推导平均单价。C 公司缺少销量披露,就应保留无法确定,不能用行业价格新闻补成公司事实。

等 A、B 的分析已经完成,再问“哪家收入改善更依赖价格”,就可以复用前面的结果,不必重搜同一份表格。但若继续问“提价能否持续”,已有量价数据并不够,还需要竞争和订单证据。

这也说明为什么这套方法不是自动正确:负责决定“够不够”的规划器本身也可能判断错。流程能够组织查证,却不能代替查证。

原文证据

真正的实验:证据找得更多了,答案只改善了一部分

作者的 MoNaCo 测试有 1,315 个问题,平均涉及 43.3 篇金标准证据文档。它不是上面的公司量价任务。

在 Qwen3-30B-Inst 设置下,一次式 NaiveRAG 的检索召回为 31.68,APT-RAG 为 50.79;回答 F1 则从 46.64 到 50.84。前者衡量证据有没有被找回,后者衡量最终回答的质量,不能把两者看成同一个准确率。

MoNaCo 还包含模型辅助的语义评估。50.84 不是“财务字段有 50.84% 正确”,更不是投资胜率。

MoNaCo:同模型、同数据集下的两段效果
环节NaiveRAGAPT-RAG变化
找到证据:召回31.6850.79+19.11 个百分点
组织答案:F146.6450.84+4.20 个点
原文位置:§4.1;Table 1–2
原文证据

另一个反转:完整配置更快,却不是分数最高

为了减少重复发送相同文档,作者加入证据聚类和批量回答,也使用同层答案复用。这些是效率设计,不应先入为主地认为它们一定提高质量。

完整配置的 F1 是 50.84,平均延迟 104.59 秒;去掉证据聚类与横向复用后,F1 为 53.96,但要 183.95 秒。也就是说,省时间确实有收益,也确实可能付出质量代价。

两项效率模块的取舍:同一消融实验
配置F1平均延迟
完整框架50.84104.59 秒
去掉聚类与横向复用53.96183.95 秒
原文位置:§3.5;Table 3
编辑理解

量化研究员应借鉴什么,而不是直接照搬什么

我的判断是,这篇的价值在“按证据缺口分配研究工作”。做财报、公告或跨公司事件研究时,可以让每个子问题都留下数据来源、所属公司、期间、单位和仍未解决的矛盾。

最需要防的是把中间总结当成原始证据。假如 B 的收入被错认成 A 的,后续复用可能把错误越写越自洽。因此每条中间结论都要能回到原文,允许它被后面的反证推翻。

对每周一次的研究看板,节省几十秒未必比少漏一条证据重要;对实时服务则可能相反。先明确质量和延迟预算,再决定是否采用论文的效率模块。不要因为它是默认配置,就认为它最适合自己的产品。

核查记录

已核查方法、表 1–2 与评测设置;未运行仓库

四种日期不混用
收录日来源网页日论文首次公开最新版本日
非 Quantocracy 补充待核2026-09-04待核
Qwen3-30B-Inst / MoNaCo,作者报告
方法回答 F1检索召回
NaiveRAG46.6431.68
ToQ46.6631.91
APT-RAG50.8450.79

原文位置:Table 2

MoNaCo:同模型、同数据集下的两段效果
环节NaiveRAGAPT-RAG变化
找到证据:召回31.6850.79+19.11 个百分点
组织答案:F146.6450.84+4.20 个点

原文位置:§4.1;Table 1–2

两项效率模块的取舍:同一消融实验
配置F1平均延迟
完整框架50.84104.59 秒
去掉聚类与横向复用53.96183.95 秒

原文位置:§3.5;Table 3

推荐 86/100 · 问题 27/30 · 证据 25/30 · 方法 23/25 · 复现 11/15

检索完整性与成本的消融有实用价值;全系统并非最高 F1,自动裁判与跨金融域外推限制结论。

尚未执行的实验思路

这只是未执行的实验设计:准备 30 个能人工核对的跨文档问题,预先列出必要证据和至少一条反证。固定语料与总费用,比较一次检索、固定拆题和动态拆题。分别记录证据遗漏、错误引用、未回答部分、费用和延迟;不要只比较答案长度或引用数量。

CC BY 4.0;以下为中文改写、重组与独立评论

返回全年目录 ↑

AI / 研究补充 / 正文核查完成

模型升级后,旧记忆究竟丢在哪一步

Does Your Agent's Memory Survive a Model Upgrade? A Controlled Study of Memory Portability

Ankit Goyal、Jaideep Ray

资料库不要只保存模型摘要;原始证据、结构化事实和模型生成笔记应分开存。

2 分钟看懂

换了模型或向量编码器,为什么旧知识明明还在,系统却变笨了?

外部记忆可能包含旧模型习惯的写法或旧向量空间。文件能打开,不代表新系统能正确取用。

编辑自设例子,非作者实验

自设例子:老研究员写的私人缩写交接给新人。笔记没丢,但有些意思只有原作者懂;统一字段表通常更容易交接。

  1. 让不同模型写入记忆
  2. 交换记忆的读取者
  3. 分别检查检索与理解
  4. 比较笔记、原文和结构化存储
关键结果与解释边界
核对项结果意味着什么
Llama 读取 NOTES37.62 → 47.53继承其他模型笔记后反而提升,迁移不是必然变差。
Qwen 读取 NOTES47.19 → 33.91反向迁移大幅下降;方向不对称。
混用向量空间54.47 → 47.53该实验中混合索引弱于完整新索引,维度相同也不能保证兼容。

不能推出什么

合成任务和固定结构有适用边界;不能推广为知识图谱永远优于文本记忆。

研究用途

升级模型与 embedding 时分别验收存储、检索、理解,不要只验文件是否迁移成功。

详细讲解

编辑理解

把忘记拆成三件事,不然很容易修错地方

一个研究助手回答不出上周的决策,至少有三种可能:当时写摘要时就没记下来;记下来了但检索没找到;已经放进上下文却被新模型误读。它们看起来都是“忘了”,修法却不同。

第一种需要回到原始记录,第二种要修检索,第三种才更像读者能力或格式兼容的问题。如果一概换更强模型,前两类问题可能完全不动。本文有价值的地方,是把记忆看成数据处理链路,而不只看成聊天软件里的一个功能开关。

原文证据

实验怎样隔离写作者与读者

作者使用 48 组合成历史与随机答案编码,比较两个模型:Llama-3.1-8B 与 Qwen2.5-7B。随机编码用于降低预训练直接知道答案的可能,采用精确评分而非模型裁判。

四类存储是原文长上下文 LC-RAW、原文分块检索 RAG、模型自由摘要 NOTES,以及按固定字段构造的知识图谱 KG-fixed。迁移 A→B 时,关键比较是“B 读 A 写的存储”与“B 读自己写的存储”,读者始终为 B。这样才能把旧存储兼容性与 B 本身的能力区分开。

RAG 的向量模型变化另做实验,而不是把读者升级、写作者升级、索引升级一次性混在一起。

原文位置:§2.1–2.3,§3
原文证据

为什么 A→B 和 B→A 必须分别看

自由摘要的结果明显不对称:Qwen 读自己的笔记为 47.19%,读 Llama 的笔记为 33.91%,下降 13.28 个百分点;Llama 读自己的笔记为 37.62%,读 Qwen 的笔记为 47.53%,反而上升 9.91 个百分点。

同表中固定结构的变动很小:Llama 为 84.56%→84.45%,Qwen 为 98.78%→98.80%。但 KG-fixed 的结构按合成任务字段设计,读取方式也不同,不能把它概括为知识图谱在所有真实任务上都达到接近 99% 的准确率。

固定读者,只更换存储写作者;准确率与方向性变化
格式/读者读自身存储读另一模型存储变化(百分点)
NOTES/Llama37.62%47.53%+9.91
NOTES/Qwen47.19%33.91%−13.28
KG-fixed/Llama84.56%84.45%−0.11
KG-fixed/Qwen98.78%98.80%+0.02
原文位置:Table 3
编辑理解

保留率的分母为何必须是新模型自己的存储

假设新模型在理想的新存储上能答对 80 题,接手旧存储后答对 60 题,它丢失的是相对自己可达能力的 20 题。若旧模型以前只答对 50 题,那么从用户体验看升级仍进步了,但从迁移质量看,新模型的潜力没有充分发挥。

这两种问题都值得问,却不能混成一个指标。前后产品效果是“60 对 50”;记忆兼容性是“60 对 80”。固定新读者的对照正是为了避免偷换问题。

双向平均也有类似风险。一个方向提高、一个方向下降,平均接近零不表示两种存储可以安全互换。实际部署只发生某一个方向,不能用另一方向的收益来抵消本次迁移损失。

原文证据

预先设的五点门槛,没有全部通过

作者在收集主结果前固定四个检验,要求效应超过 5 个点,并通过四重比较的 Holm 校正。对称的笔记迁移损失 H1 与“笔记比固定结构更差”H4a 都未得到计划检验支持;混合向量索引的损失 H2 为 +6.95 个准确率百分点,原始历史修复的优势 H7a 为 +8.90 个百分点,得到支持。

这里 H1/H4a 的尺度是机会校正后的保留表现,H2/H7a 是准确率百分点,不能把四个数字不加区分地排在一起。作者先做 t 检验,之后补做预定 bootstrap,结论一致,但后者是在看过初步结果后进行,不能重新包装成完全按原计划的一次性检验。

原文位置:§3.5,Table 1–2
编辑理解

这个负结果为什么反而值得读

如果只看标题和方向性大幅下降,很容易写成“论文证明换模型普遍破坏记忆”。但预先计划的对称检验并不支持这个强结论。更稳妥的说法是:存在明显方向依赖,需要逐方向验收;混合索引和丢弃原文是本实验中证据更明确的问题。

统计上,“没通过超过五点的检验”不等于“没有任何影响”,也不等于“两个系统完全等价”。这只是原先声称足够大的效应没有得到支持。阈值和统计单位在这里直接决定结论,而不是文章末尾无关紧要的技术细节。

48 组历史才是主要独立单位;不能把同一历史里的大量问题都当独立样本来夸大把握。实际使用时,应按项目、客户或文档集合组织检验,而不是只追求题目总数。

原文证据

向量维度一样为什么仍不能混用

向量实验把 bge-large-en v1.0 升至 v1.5,两者都是 1,024 维。完整重建后的答案准确率为 54.47%,旧索引为 42.57%,50/50 混合索引为 47.53%。混合方案仍比旧版好,但损失了完整迁移的大部分增益;没有维度报错不代表空间兼容。

原文位置:§4.3,Table 4
编辑理解

用坐标系解释这件事,比记住版本号更有用

这是我的自设几何例子:旧模型把某主题映成向量 (1,0),新模型因整体旋转把同一主题映成 (0,1)。新查询也是 (0,1)。它与新文档余弦相似度为 1,与语义相同的旧文档却为 0。两个都是二维、数组长度完全合法,但跨空间距离不再对应同一种语义。

所以更新“回答问题的模型”和更新“计算向量的模型”是两种迁移。如果向量模型没变,换读者并不必然要求重建索引;如果向量模型变了,应分别建立与测试新旧索引,不能只因维度一致就合并排序。

原文证据

只有摘要时,润色为什么救不回被删除的事实

作者的笔记修复实验中,仅改写存储在所测预算下未达到 90% 的恢复目标;保留原始历史时,Qwen 在 48 组中恢复 34 组,而另一方向受到输出长度限制,未恢复成功。原文可用不等于一定恢复,但没有原文会失去找回已删事实的路径。

因此不能把结果解释成“让新模型把旧摘要重写一遍就好了”。修复输入是否包含原始证据,是比文风兼容更根本的变量。

原文位置:§4.4,Appendix E

核查记录

已核查实验设计、表 2–3 与限制;未复现实验

四种日期不混用
收录日来源网页日论文首次公开最新版本日
非 Quantocracy 补充待核2026-09-04待核
固定读者,只更换存储写作者;准确率与方向性变化
格式/读者读自身存储读另一模型存储变化(百分点)
NOTES/Llama37.62%47.53%+9.91
NOTES/Qwen47.19%33.91%−13.28
KG-fixed/Llama84.56%84.45%−0.11
KG-fixed/Qwen98.78%98.80%+0.02

原文位置:Table 3

推荐 87/100 · 问题 28/30 · 证据 25/30 · 方法 22/25 · 复现 12/15

双向迁移与阴性结果值得读;合成工作负载及模型方向依赖限制泛化,不能宣称所有旧记忆都损坏。

尚未执行的实验思路

本周刊保留原论文地址、精确版本、证据位置和结构化笔记;中文解读只作为派生内容。未来修订观点时追加修订记录,不直接抹去旧结论。事实记录至少包含对象、时间、原始来源和限定条件,不能只存一句“这篇很好”。 若将来增加长期检索,给每条向量记录版本并隔离索引;先用冻结的历史问题验收,再切换。题目要包括时间更新、意见撤回和“材料没说”的情况,避免只验证简单记忆题。 这不是立即建设知识图谱的理由。先保留可恢复的证据和稳定字段,已经能获得大部分工程收益;只有复杂关系查询确实需要时,再引入图数据库。

CC BY 4.0;以下为中文改写、重组与独立评论

返回全年目录 ↑

AI / 研究补充 / 正文核查完成

个股历史长短不齐,怎样估计组合风险

End-to-End Neural Shrinkage of Indefinite Pairwise Correlation Matrices for Small-Cap-Inclusive Portfolios

Christian Bongiorno、Lorenzo Villassero

保留历史不完整的个股需要正面处理缺失数据,而不是删掉它们或把缺失收益填成零。

2 分钟看懂

新上市股票历史短、老股票历史长,怎样一起估计组合风险?

只取共同历史会浪费老股票数据,粗暴补齐又可能扭曲相关性。作者让风险估计适应不等长样本。

编辑自设例子,非作者实验

自设例子:甲股票有 8 年历史,乙只有 1 年。我们既不愿删掉甲的前 7 年,也不愿假装乙在那 7 年有真实行情。

  1. 按股票对提取可用重叠信息
  2. 学习并约束风险矩阵结构
  3. 据此构造长期多头组合
  4. 在逐年扩展样本中检验
关键结果与解释边界
核对项结果意味着什么
作者年化波动11.17%是所测组合的风险结果,不是单只股票预测误差。
年化收益9.30%作者 2000—2025 实验设置,不能当作 A 股复现。
最大回撤−41.3%风险改善不等于没有大幅回撤。

不能推出什么

本文实验区间与约束是作者设置;本看板没有替用户运行 A 股回测。

研究用途

适合研究新股或数据缺失下的风险估计,先核对训练目标与实际组合约束。

详细讲解

编辑理解

先分清:它在估计风险,不是在预测哪只股票涨

组合优化需要知道股票彼此怎样一起波动。即使完全不预测收益,也可以尝试把权重分配给组合风险较低的方向。问题是,新上市、间歇交易或历史不齐的个股,没有一张所有日期都完整的收益矩阵。

删除所有不完整个股会改变股票池;删除所有存在缺失的日期又可能丢掉大半历史。更自然的做法是每对股票使用各自重叠的数据,但不同配对来自不同时间段,最后拼出的关系未必能同时成立。这是论文要处理的数学问题,不是“缺失值填好就行”。

原文证据

作者方法和测试条件

RIEnet 用带缺失掩码的收益、成对重叠长度和带符号的特征值,学习正的逆谱并重建有效协方差。训练目标为未来五日最小方差组合风险,测试统一使用只做多优化器。美国个股测试期 2000—2025,最多 1,500 只,回看 1,200 个交易日,每五日调仓,并模拟交易成本。首个训练模型使用 1990—1999,不能当作短样本 A 股复现。

原文位置:§2–4,Table 1
编辑理解

三只股票的例子:每一对都合理,合在一起却不可能

以下矩阵是我自设的数学例子,不是作者数据。设 A 与 B 的相关为 0.9,A 与 C 为 0.9,B 与 C 却为 −0.9,三只股票方差都为 1。每个单独相关系数都在 −1 到 1 之间,看起来合法。

但把它们拼成矩阵后,特征值为 1.9、1.9、−0.8。取权重 (−1,1,1),组合估计方差 w′Cw = −2.4。现实方差不可能小于零,这说明三组局部估计没有构成一个整体有效的风险模型。

例子中的负方差方向含卖空;只做多约束可能避开这个具体方向,但不能因此宣布原矩阵就是合法协方差。数学有效性和某组投资约束下是否恰好出错,是两件事。

自设相关矩阵,仅用于解释不一致的成对估计
ABC
A10.90.9
B0.91−0.9
C0.9−0.91
编辑理解

修成合法矩阵与修成好预测矩阵,仍是两道关

最直接的修复是把负特征值抬到一个小正数。但这只保证不会出现负方差,不保证未来风险估计好。一个很小的正特征值在取逆后会变得很大,优化器仍可能把权重集中到估计噪声造成的“便宜风险方向”。

在刚才的例子中,用 C_new=(1−α)C+αI 做一个简单收缩。最小特征值变成 −0.8+1.8α;因此 α 大于 4/9 后才严格为正。取 α=0.5 时最小特征值为 0.1。这个算例只说明怎样恢复有效性,不说明 0.5 是实际投资的最优参数。

这便是收缩的实质:宁可牺牲一点对历史样本的贴合,也不要对不可靠方向过度自信。可学习的收缩需要进一步证明,它比廉价、固定的修复规则更能降低未来风险,而不是只会把训练数据拟合得更漂亮。

编辑理解

为什么重叠样本长度应该进入风险模型

两个相关估计都为 0.3,一个来自约 500 天重叠记录,一个只有 25 天,置信程度显然不同。如果优化器把它们当同样可靠,短历史个股可能因为偶然低相关而被分到过高权重。

因而缺失掩码不是清洗结束就丢掉的辅助变量,它包含“这个估计有多可靠”的信息。更困难的是,组合方向由很多股票共同构成,不能只给每只股票一个历史长度就完全概括不确定性;需要考虑各对股票实际共同出现多久。

对真实样本,这也提示一个额外检查:缺失是否随机?停牌、上市与退市往往关联公司状态。仅处理矩阵正定性,不能自动解决这种经济上的选择问题。

编辑理解

把作者的结果放回风险目标里

下表是作者在其模拟执行条件下的结果,不是我们跑出的数据。RIEnet 与 Factor 的年化波动为 11.17% 与 14.08%,差 2.91 个百分点,相对下降约 20.7%;CAGR 是另一项指标,不能拿波动的相对下降冒充收益提升。

如果最终目的是风险控制,我会先看不同市场阶段的实现风险、预测风险与集中度,再看 Sharpe。较高 CAGR 可以是组合路径的结果,却不能证明模型学会了预测个股收益。更不能把 26 年汇总数字直接搬到当前短样本。

成本已模拟是加分项,但其规模、冲击函数和成交假设仍然决定结果。在另一个市场,交易限制与流动性不同,不能把“作者扣过费”理解成“我们的费用也已经被处理”。

原文位置:§4.3–5,Table 1
编辑理解

我最想追问的对照是什么

同一股票池、同一只做多约束下,应把风险估计器与执行器完全分离。否则若某方案额外限制了单股权重、少交易或避开难成交股票,风险改善未必来自矩阵估计。

还应同时比较“只修复正定性”“修复后简单收缩”“因子或回归补全”与神经方法。若复杂模型只战胜明显脆弱的样本估计,而没有战胜这些强基线,就不足以支持部署。短样本尤其需要这种克制:股票数量多不代表拥有很多独立市场阶段,横截面不能无限替代时间样本。

我的重点不是质疑所有神经风险模型,而是把成功条件说清:它应当在未参与选择的时期,以可比换手和集中度,实现更稳定的风险。

核查记录

已核查方法、交易假设及表 1–2;未执行回测

四种日期不混用
收录日来源网页日论文首次公开最新版本日
非 Quantocracy 补充待核2026-08-31待核
作者美国个股回测,2000–2025,已含所模拟交易成本
方法年化五日波动CAGR最大回撤
RIEnet11.17%9.30%−41.3%
Factor14.08%7.33%−51.5%
等权20.90%7.53%−58.5%

原文位置:Table 1

自设相关矩阵,仅用于解释不一致的成对估计
ABC
A10.90.9
B0.91−0.9
C0.9−0.91

原文位置:NOT_FOUND

推荐 86/100 · 问题 28/30 · 证据 24/30 · 方法 23/25 · 复现 11/15

处理不齐个股样本直接相关,统一执行约束下比较风险;历史长期验证不等于当前 A 股可迁移,需重估稳定性。

尚未执行的实验思路

不照搬多年扩展训练。先画出当前个股样本的有效历史长度和成对重叠分布,检查负特征值是否真实存在、严重到什么程度。若缺失问题很小,论文复杂度可能没有必要。 在相同股票池与实际可用短窗口内,先比较等权、只做多最小方差、正定修复加简单收缩等轻量基线;窗口在看测试结果前锁定,并报告敏感性,而不是挑最好的一档。若再加入神经模型,必须把调参月份与最终评价月份隔离。 输出不仅是净值,还包括每期权重、实现波动、换手、持仓集中度、最短重叠长度与费用。这个试验回答“缺失处理是否改善组合风险”,不冒充选股 alpha,更不混入转债。

返回全年目录 ↑