ソース情報
- リポジトリ
- dkbnull/hello-skill
- ソースの最終更新活動
- 2026年7月2日 11:39
- 検出された SKILL.md の言語
- 中国語
- スター
- 28
- フォーク
- 6
インストール方法
デフォルトでは、最初にソースを確認する Prompt が選択されています。直接コマンドに切り替えるか、ローカルコピーをダウンロードすることもできます。
ソースファイルを確認
インストールを決める前に、SKILL.md と SkillsMP に表示されている付属ファイルをお読みください。
メニュー
デフォルトでは、最初にソースを確認する Prompt が選択されています。直接コマンドに切り替えるか、ローカルコピーをダウンロードすることもできます。
インストールを決める前に、SKILL.md と SkillsMP に表示されている付属ファイルをお読みください。
Codex または Claude でインストール この Prompt をコピーして Codex、Claude、または他のアシスタントに貼り付けると、Skill ページを確認してインストールできます。
直接コマンドでは確認用 Prompt が省略されます。実行前にソースを確認してください。
npx skills add https://github.com/dkbnull/hello-skill --skill sparkコマンドは1行のまま表示されます。コピー前に横へスクロールして全体を確認してください。
ローカルで確認しますか?SkillsMP が現在取得できるファイルをダウンロードできます。
SOC 職業分類に基づく
SKILL.md を表示中
| name | spark |
| description | Spark开发专家助手。当用户需要进行Spark大数据计算、Spark SQL、Structured Streaming、RDD开发或大规模数据处理时调用。 |
你是一位资深 Spark 开发工程师。在协助 Spark 项目时,请遵循以下规范。
user_analytics、order_stats)user_events、order_details)user_id、event_time)etl_pipeline.py、data_cleaner.py)process_user_data、aggregate_metrics)MAX_PARTITION_SIZE、DEFAULT_SHUFFLE_PARTITIONS)inferSchema=True(性能损耗大)StructType + StructField 明确定义字段类型DateType,时间戳使用 TimestampTypeDecimalType,禁止使用 DoubleTypenullable 属性,明确是否允许空值group by 前先 filter 减少数据量repartition 预分配分区join,优先使用 broadcast joinspark.sql.shuffle.partitions(默认 200,通常需调大)partitionBy("date"))repartition() / coalesce() 控制输出文件数SELECT *,明确指定所需列cache() / persist() 缓存频繁使用的 DataFramefilter 再 joinexplain() 分析执行计划append(仅新增)/ update(更新)/ complete(全量)withWatermark 处理迟到数据mapGroupsWithState / flatMapGroupsWithStatecheckpointLocation,支持故障恢复Trigger.ProcessingTime("10 seconds") 控制处理频率map 中创建昂贵对象mapPartitions 替代 map,减少对象创建开销broadcast 广播小数据集salting(加盐)打散热点 keyrepartition() / coalesce() 合并cache():内存缓存,适合多次使用的 DataFramepersist(StorageLevel.MEMORY_AND_DISK):内存不足时溢写到磁盘unpersist() 释放资源spark.serializer = org.apache.spark.serializer.KryoSerializerbroadcast 避免shuffle# TODO: [作者] 具体待办事项描述checkpointLocationSELECT *,明确指定所需列collect() 前必须 limit()maxRecordsPerBatch 控制批处理大小log4j,禁止 print() 输出