迪仔2026-04-15·社区交流单品种时序策略的机器学习建模2:数据处理上一篇文章我们对单品种时序策略建模的整体流程做了介绍。从这篇文章开始,我们逐一对每个步骤进行较为细致的探讨,看看如何从最底层构建完整的时序模型框架。 一般来说,在机器学习的各个环节中,数据的重要性大于特征,特征的重要性大于模型。所谓"Gar…#代码分享#学习资源#机器学习#Python
AlphaSmith2025-08-21·社区交流PandaQAuantFlow本地部署之后怎么手动更新到最新数据?概述 PandaQAuantFlow开源之后,社区很多小伙伴去下载也本地部署了,但是本地的行情数据只到2025-05-15,没法使用最新的数据进行回测。好在pandafactor里面提供了自动更新数据库的功能,以下笔者将简单介绍如何进行手动…#数据清洗#数据存储
PandaAI官方2025-08-01·因子大赛因子积累的探索与踩坑因子积累的探索与踩坑 1.1 探究的原因 因为 XGB 或者 MLP 等等吧,模型如果需要有好的效果,最核心的不是模型参数或复杂度,而是因子的非线性复杂度要高。核心还是因子。一般作为普通投资者来说,最简单的就是研报复现以及公共平台的因子获取…#数据清洗#数据存储#数据API
本本本2025-08-01·量化策略#因子积累的探索与踩坑因子积累的探索与踩坑 1.1 探究的原因 因为 XGB 或者 MLP 等等吧,模型如果需要有好的效果,最核心的不是模型参数或复杂度,而是因子的非线性复杂度要高。核心还是因子。一般作为普通投资者来说,最简单的就是研报复现以及公共平台的因子获取…#量化策略#数据清洗#数据存储#数据API
ELVES2025-08-01·机器学习 # 因子积累的探索与踩坑因子积累的探索与踩坑 1.1 探究的原因 因为 XGB 或者 MLP 等等吧,模型如果需要有好的效果,最核心的不是模型参数或复杂度,而是因子的非线性复杂度要高。核心还是因子。一般作为普通投资者来说,最简单的就是研报复现以及公共平台的因子获取…#量化策略#数据清洗#数据存储#数据API
无名的人2025-07-08·数据源与处理0基础学量化:基于Akshare和Mongodb构建数据获取和因子【第一期】一、 引言 在A股量化投资中,构建完善的因子库对于策略研发和回测效率至关重要。传统基于CSV文件存储因子数据存在冗余、跨周期计算效率低和扩展性差等问题,而通过建立数据库式的因子库,可以显著提升数据管理和检索效率。本项目旨在基于AkShare…#新手入门#经验分享#Python#mongodb
Newt2025-06-22·数据源与处理兴业证券==高频因子==预处理概述 因为高频数据量非常大,若要进行多年度的回测需要大量的时间计算,所以我采用先计算因子值,计算完之后再执行回测,本篇主要分享可以优化的方向以及一些高频数据预处理的发现。 1.高频因子特点 - 相比低频因子IC半衰期更短 - 需要更高频的调…#新手入门#经验分享#高频交易#clickhouse
AlphaSmith2025-06-07·社区交流因子数据中性化处理之行业中性化1. 概述 行业中性化(Industry Neutralization)旨在从因子中剔除行业所带来的系统性偏差,使因子能够更真实地反映个股的特质(idiosyncratic characteristics)。许多因子天然地与特定行业相关联,…#新手入门#经验分享#Python#数据清洗
AlphaSmith2025-06-06·社区交流精华因子数据中性化处理之市值中性化1.概述 在计算完因子数据之后,进行下一步的模型训练之前,通常需要对因子数据进行预处理,以及中性化处理。其中预处理比较简单,一般就是3倍MAD截断,zscore标准化,缺失值填充为0。中性化稍微复杂一些,本文将从市值中性化开始介绍如何进行市…#新手入门#经验分享#Python#数据清洗
ELVES2025-05-23·机器学习精华线性因子到端到端模型的尝试(二):提供数据集+训练代码1.1 背景 这几天踩了不少数据的坑,趁热打铁总结一下,也希望能帮大家少走点弯路。数据清洗这块,很多人觉得是琐事,其实它对最终策略效果的影响非常大。模型的好坏,很多时候不是算法决定的,而是你喂进去的数据质量决定的。下面我举几个例子,大家就懂…#机器学习模型#机器学习#多因子模型#中频交易