| name | data-throughput-accelerator |
| description | 当大型数据摄入、回填、导出、ETL、仓库加载、清单追赶或表同步需要大幅提速同时保持数据正确性时使用。 |
| origin | ECC |
| tools | Read, Write, Edit, Bash, Grep, Glob |
数据吞吐加速器
当瓶颈在于移动、转换或保存大量数据时使用此技能。目标不仅仅是速度。目标是更快地将正确的数据落在正确的位置并有证明。
首要区分
在优化之前先区分这些:
- 源提取速度;
- 网络传输速度;
- 仓库/加载速度;
- 转换速度;
- 服务表新鲜度;
- 任务运行时的实时尾部增长。
一个管道可能"很快",但如果新数据到达速度快于最终追赶窗口,它仍然可能显得落后。
快速路径启发式
- 将计算移到数据已存在的位置。
- 优先使用仓库原生扫描、连接和追加来处理大型已落地文件。
- 使用清单或检查点,以便跳过已完成的文件/分区。
- 使用与读取和追加模式匹配的分区和聚类。
- 批量处理小文件、请求和写入。
- 通过唯一键、清单或可替换的暂存区使写入幂等。
- 保持原始表、派生表和服务表分别可追溯。
工作流
- 读取当前的源、目标和清单契约。
- 测量积压:外部文件、清单行、原始行、派生行、最小/最大时间戳和未处理计数。
- 运行安全的追赶或样本基准测试。
- 比较变体:批量大小、工作线程数、仓库 SQL、文件分组、暂存形状和清单更新方法。
- 仅推广保持计数和时间戳一致的最快路径。
- 将路径固化为 CLI、定时任务、工作流或运维手册。
- 在固化路径执行后重新运行最终核算。
核算输出
使用硬核算块:
数据吞吐结果:
- 发现的源文件:294
- 本次运行处理的文件:294
- 新增原始行数:9,683,598
- 新增派生行数:8,917,585
- 剩余尾部:回读时 24 个文件
- 运行时间:38.7s
- 正确性关卡:清单计数和表最大时间戳匹配
防护栏
- 不要删除原始数据以使指标看起来更好。
- 不要静默跳过失败文件。
- 不要混合历史回填状态与实时尾部新鲜度。
- 在目标表和清单一致之前不要称管道完成。
- 对于金融、医疗、受监管或影响客户的数据,保留重放证据和审批关卡。