跳转至

trading

策略假想 -> 数据获取 -> 数据清洗 -> 构建因子 -> 单因子检验 -> 生成信号 -> 搭建回测 -> 组合优化 -> 压力测试 -> 模拟盘 -> 优化迭代 -> 模拟拟合信号

聚宽还是本地搭建?

  • 日频A股: 聚宽,自建系统的ROI为负
  • T+0/可转债高频/期货/多市场套利: 本地搭建,并接入 QMT(迅投) 或 PTrade(恒生) 的本地SDK,因为它们支持极速柜台,且策略源码完全本地化。

数据分类

  1. 传统标准化数据(基本面与量价)

  2. 基本面数据: 来自财报(利润表、资产负债表)、业绩预告、分析师一致预期。衍生出估值类(PE、PB)、成长类(ROE增速)、质量类(毛利率、负债率)因子。

  3. 量价行情数据: 来自交易所的Level1/Level2行情。衍生出动量反转、波动率、流动性(换手率、买卖价差)以及资金流向(大单净流入)等因子。
  4. 宏观数据: 来自统计局、央行。衍生出利率敏感度、通胀对冲、PMI变动等宏观驱动因子。
  5. 技术指标: 人工二次合成指标,“线性”且“滞后”。在2026年的量化前沿,纯技术指标作为“阿尔法(超额收益)来源”的边际效用已经极低,因为全市场肉眼可见的指标信号早已被算法消化殆尽。
如今技术指标在量化的定位
  • 作为“风险剥离项”: 用来过滤市场极端噪音。比如,当RSI > 90(极度超买)时,模型会主动降低该股的风险暴露权重,而非据此直接做空。
  • 作为“非线性激活条件”: 不直接用指标值,而是用指标值的变化斜率(二阶导)。比如,布林带“收口”代表波动率即将爆发,这个“收口”的信号被用作触发高频交易的开关。
  • 作为“机器学习输入层”: 在2026年的主流做法中,研究员往往放弃MACD/KDJ,而是直接将原始的OHLCV输入LSTM或Transformer模型。因为模型自己能从原始数据中学到比MACD更复杂、更前瞻的形态(比如“头肩顶”的神经网络抽象表达),人工设定的公式反而限制了模型的想象力。

建议:

  • 中低频交易(周度/月度换仓),建议剔除MACD、RSI等标准指标,因为它们噪声太大且同质化严重;优先使用乖离率(BIAS)或量价相关系数的变异形态。
  • 高频交易(分钟级),可以保留盘口委托量变化和瞬时波动率,但坚决抛弃MA均线系统,因为它天然的滞后性在高频里会让你反复止损。
  1. 另类数据(Alternative Data)——当前增长最快的来源

这是为了获取信息优势,抢占机构“信息差”的核心战场(截至2026年,A股超60%的私募已引入另类数据),大卫翁某期节目也提到过该类数据。

  • 卫星与地理空间数据: 监测港口船舶拥堵、车企工厂停车坪库存、油田火焰、商场停车场车流,预判宏观经济或企业销量。
  • 电商与消费大数据: 抓取淘宝、京东等平台的SKU销量、价格波动、用户评论情感,用于预判消费类公司的季报营收。
  • 舆情与自然语言(NLP): 实时抓取股吧、雪球、新闻头条、甚至微信群的讨论热度与情感极性,衍生出“舆情热度因子”和“监管关注度因子”。
  • 供应链与关联网络: 利用企业工商数据(天眼查/企查查),构建上下游传导关系,衍生出“产业链上游紧缺传导因子”。

  • 高频与订单簿微观结构(高频/日内)

来源是Tick级逐笔委托与成交数据,侧重于市场微观参与者的“行为痕迹”。

  • 委托挂单变化: 捕捉买卖盘口的厚度、挂单撤单频率,衍生出“主力挂单虚挂率”和“冰山订单识别因子”。
  • 成交撮合特征: 分析每笔大单的主动买卖方向、连续成交的节奏,衍生出“微观流动性冲击因子”和“大单吃货强度”。

  • 人工智能挖掘(遗传规划与深度学习)——2026年的前沿来源

这不再是“读数据”,而是“让算法从数据中无中生有创造新因子”。

  • 遗传规划(GP): 设定基础算子(加减乘除、开方、对数、条件判断),让算法在历史海量量价数据中暴力进化,生成人类无法直观理解的“表达式因子”(例如极为复杂的嵌套公式)。
  • 图神经网络(GNN): 将全市场股票看作一个动态关系图谱,来源不仅是股票自身数据,更是其“邻居节点”(同行业、同概念、同机构持仓)的涨跌关联,衍生出“关联传导因子”。
  • 大模型(LLM)隐空间因子: 将财报PDF、研报长文本直接输入大模型,提取其中微妙的语气变化(如管理层“谨慎乐观”的程度),转化为高维语义向量作为因子。

特别提醒(实战视角):

在2026年的监管环境下,因子的“来源合规性”越来越重要。使用爬虫获取非公开数据(如非授权的APP日活)已被明令禁止。

同时,“因子失效速度”越来越快,现在的主流趋势是“源数据层”(如高频原始ORDER数据)与“算力层”结合,通过在线学习每天更新因子系数,而非固守某个静态来源。

个人量化

  1. 数据: 资源有限,放弃另类数据。

    • 基础行情: AKShare获取日频OHLCV、复权因子。
    • 财务与资金: 新浪财经/东方财富网公开API抓取季报利润表,以及每日北向资金(陆股通)持仓和融资融券余额(这两个是官方免费公布的,且对A股定价影响极大)。
  2. 策略重心: 放弃“预测”,转向“反应”

    发挥“船小好掉头”的优势:

    • 主攻“价格异动+资金验证”因子: 不要看单一涨跌。重点构建“量价背离因子”(如: 收盘价创新高但成交量未放量,或上涨中主动卖单增大)。用免费的逐笔大单数据(东财Level2免费版有)计算“大单净买入占比”,日频换仓完全够用。
    • 巧用“拥挤度”因子: 利用免费公开的行业ETF份额变化和龙虎榜机构席位数据。当某概念ETF份额连续3日暴增但股价滞涨时,就是极佳的“高拥挤卖出信号”,这比复杂模型更有效。
    • 小资金+低换手: 构建10-15只股票的组合,每周调仓一次(而非每天),用“多因子打分”(估值30% + 动量30% + 资金流40%)。
  3. 避雷

    • 剔除上市不足60天的新股和每日成交额低于3000万的股票
    • 不预测绝对涨跌,只计算个股在全市场4000多只股票中的强度排名(前10%强)
    • 避开“未来函数”陷阱,只使用历史数据训练模型,不使用未来数据。

北向资金

北向资金,通俗来说就是“外资通过香港交易所买入A股的资金”。

虽然日均成交额只占A股总成交的10%-15%左右,但被市场称为“聪明钱”。

  • 信息优势:以北向资金为代表的海外机构投资者,通常更注重价值投资和基本面分析,研究能力较强,往往能提前捕捉到行业拐点。
  • 风偏指标:它代表了国际资本对中国宏观经济的看法。如果持续大幅净流入,通常被视为看好中国经济;反之则被视为避险或看空。
  • 示范效应:很多内地游资和散户会参考北向资金的动向进行操作,容易引发跟风,从而放大市场波动。
  • 持仓明细重仓股的增减持动作,往往是市场重要的投资参考。