Skip to main content

data-management

彩票数据管理手册,包含数据抓取、增量更新逻辑及多彩种数据预处理规则。

跳到安装

来源信息

仓库
konglr/Lottery
最近来源活动
2026年3月13日 13:14
检测到的 SKILL.md 语言
中文
星标
14
分支
5

安装方式

默认使用会先检查来源的 Prompt;你也可以切换为直接命令,或下载本地副本。

检查来源文件

决定是否安装前,请先阅读 SKILL.md,以及 SkillsMP 当前展示的配套文件。

正在显示 SKILL.md

SKILL.md
来源说明 · 只读预览
name
data_management
description
彩票数据管理手册,包含数据抓取、增量更新逻辑及多彩种数据预处理规则。
# 彩票数据管理手册 本项目的数据流程分为 **数据同步 (Sync)** 和 **数据处理 (Process)** 两个核心环节。本手册详细记录了相关的逻辑与规则。 ## 1. 数据同步逻辑 (Data Synchronization) 数据同步主要由 `request_data_update.py` 负责,采用增量同步与覆盖更新相结合的策略。 ### 1.1 增量/覆盖同步策略 为了解决中奖详情(winnerDetails)可能延迟发布的问题,同步逻辑遵循以下规则: - **抓取范围**:每次同步尝试获取官方接口最近的 100 条记录。 - **期号匹配**:对比本地最新期号(`local_latest`),抓取所有期号 **>=** `local_latest` 的数据。 - **覆盖更新**:使用 `>=` 而非 `>` 是为了确保本地最新的一期能够被重新抓取。如果官方在中奖数据到账后更新了列表,本地记录将被最新的、含完整中奖信息的记录覆盖。 - **去重处理**:合并数据后,按期号降序排列并执行 `drop_duplicates`,确保每期仅保留最新抓取到的版本。 ### 1.2 异常处理 - **接口校验**:同步前会对比 `local_latest` 与系统总期数。如果本地已是最新,则跳过抓取。 - **格式归一化**:不同彩种的期号格式(长/短格式)在对比前会进行归一化处理(由 `normalize_issue` 函数执行)。 --- ## 2. 数据处理规则 (Data Processing Rules) 数据预处理由 `request_process_all_data.py` 负责,核心目标是将原始 JSON 响应转化为标准化的分析特征。 ### 2.1 奖级映射与归一化 程序根据官方备注(`remark`)和奖级 ID(`awardEtc`)进行智能映射: - **双色球 (SSQ)**: - 识别 1-6 等奖。 - **福运奖**:第 7 顺位奖项或备注为“福运奖”的记录映射为标准 `福运奖` 字段。 - **超级大乐透 (DLT)**: - 支持 1-9 等奖。 - **追加数据**:仅大乐透保留 `追加注数` 和 `追加奖金` 字段。 - **福彩3D / 排列三 / 排列五**: - 映射为 `直选` / `单选`、`组选三`、`组选六` 等特定奖项名称。 ### 2.2 字段自动清理 (Generalized Column Cleanup) 为了保持数据纯净,程序会执行严格的列清理: - **白名单机制**:基于每个彩种定义的 `unique_tiers` 动态生成允许的列名集合。 - **无用列删除**: - 自动删除非当前彩种定义的奖级列(如双色球中的 `七等奖` 或 `追加*` 相关列)。 - 自动清理历史遗留的错误列(如 3D 数据中误存的 `一等奖` 字样列)。 - 仅保留 `注数`、`奖金` 以及(仅限大乐透)`追加*` 相关后缀的奖项列。 ### 2.3 特征工程 预处理阶段会自动计算以下统计指标: - **基础指标**:和值、跨度、奇偶比、大小比。 - **连号/跳号**:二连、三连及以上,二跳、三跳等。 - **形态指标**:AC 值、重号、邻号、孤号。 - **区域分布**:根据三区划分逻辑计算各区分布情况。 --- ## 3. 运行指南 - **同步最新数据**:执行 `python request_data_update.py`。 - **全局重处理**:如果需要重新生成所有历史数据的特征或应用新的清理规则,执行 `python request_process_all_data.py`。 --- *上次更新:2026-03-13*
在 GitHub 查看