一键导入
data-analysis
對 CSV/Parquet/JSON 資料進行分析。當使用者需要進行資料分析、統計計算、趨勢識別或資料視覺化時使用。
用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
菜单
對 CSV/Parquet/JSON 資料進行分析。當使用者需要進行資料分析、統計計算、趨勢識別或資料視覺化時使用。
用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
基于 SOC 职业分类
在使用者要設計網站、Web App 或元件介面時使用。常見觸發像「做 landing page」「設計 dashboard」「規劃 component UI」。輸出可上線介面與設計系統;不取代產品策略或純品牌研究。
在使用者要把模糊想法整理成可開發 spec 時使用。常見觸發像「整理需求成 spec」「補驗收條件」「拆分階段開發計畫」。輸出技術規格、白話規格與可直接貼用於 Codex / Claude Code 的分階段 instructions;不直接代替正式文件發布。
在非程式開發者要用 vibe coding 與 coding agent 協作時使用。常見觸發像「幫我整理開發準則」「定義交付邊界」「規劃驗證方式」。輸出需求表達、邊界與風險控管準則;不直接取代實作。
當使用者要拆解大型、混亂、跨部門、反覆卡關或高不確定性的難題,或明確要求做問題拆解、issue tree、根因與對策分層時使用。先分清楚現象、目標落差、真正問題與根因假設,再判斷問題是範疇型、分析型、動態系統型、研究型或交付型,最後用 issue tree/MECE、WBS、系統思考、驗收標準、依賴排程、資源分派與流動指標,產出可執行的問題拆解報告、工作包、關鍵路徑、並行策略與 PDCA 回饋節奏。
當使用者要替代解法、不同思路、更簡單或更穩定做法時使用。將現有方案重構成結構問題,提出多條可落地方案與最低摩擦解。
建立定期任務(每日晨報、每週回顧)。當使用者需要設定自動化的、定期執行的任務時使用。
| name | data-analysis |
| description | 對 CSV/Parquet/JSON 資料進行分析。當使用者需要進行資料分析、統計計算、趨勢識別或資料視覺化時使用。 |
本技能旨在提供一個標準化的資料分析流程,支援多種資料格式,並能夠生成有洞察力的分析結果和視覺化。
process.exec: 在安全的 Python 沙箱中執行資料分析程式碼sandbox_run: 提供更安全的沙箱環境(預設拒絕主機執行)與使用者溝通,明確分析的目標和期望的輸出。
需求澄清清單:
使用 Python 在沙箱環境中載入資料檔案,並進行初步探索。
探索步驟:
Python 程式碼範例:
import pandas as pd
import numpy as np
# 載入資料
df = pd.read_csv('data.csv')
# 基本探索
print(f"資料形狀: {df.shape}")
print(f"\n資料類型:\n{df.dtypes}")
print(f"\n缺失值:\n{df.isnull().sum()}")
print(f"\n前 5 行:\n{df.head()}")
print(f"\n統計摘要:\n{df.describe()}")
根據需要進行資料清理,包括處理缺失值、異常值、資料類型轉換等。
清理操作:
Python 程式碼範例:
# 處理缺失值
df = df.dropna() # 或 df.fillna(df.mean())
# 移除重複行
df = df.drop_duplicates()
# 轉換資料類型
df['date'] = pd.to_datetime(df['date'])
# 識別異常值(使用 IQR 方法)
Q1 = df['value'].quantile(0.25)
Q3 = df['value'].quantile(0.75)
IQR = Q3 - Q1
outliers = df[(df['value'] < Q1 - 1.5*IQR) | (df['value'] > Q3 + 1.5*IQR)]
根據使用者的需求進行具體的分析。常見的分析類型包括:
描述性統計分析:
分組分析:
趨勢分析:
相關性分析:
Python 程式碼範例:
# 描述性統計
print(df.describe())
print(f"平均值: {df['value'].mean()}")
print(f"中位數: {df['value'].median()}")
print(f"標準差: {df['value'].std()}")
# 分組分析
grouped = df.groupby('category')['value'].agg(['mean', 'sum', 'count'])
print(grouped)
# 相關性分析
correlation = df[['col1', 'col2', 'col3']].corr()
print(correlation)
根據分析結果生成適當的視覺化圖表,幫助使用者更好地理解資料。
常見的視覺化類型:
Python 程式碼範例:
import matplotlib.pyplot as plt
import seaborn as sns
# 直方圖
plt.figure(figsize=(10, 6))
plt.hist(df['value'], bins=30, edgecolor='black')
plt.xlabel('Value')
plt.ylabel('Frequency')
plt.title('Distribution of Values')
plt.savefig('histogram.png', dpi=300, bbox_inches='tight')
plt.close()
# 箱線圖
plt.figure(figsize=(10, 6))
sns.boxplot(data=df, x='category', y='value')
plt.title('Value Distribution by Category')
plt.savefig('boxplot.png', dpi=300, bbox_inches='tight')
plt.close()
# 相關性熱力圖
plt.figure(figsize=(10, 8))
sns.heatmap(df.corr(), annot=True, cmap='coolwarm', center=0)
plt.title('Correlation Matrix')
plt.savefig('correlation_heatmap.png', dpi=300, bbox_inches='tight')
plt.close()
將分析結果、關鍵發現和建議整理成一份清晰的報告。
報告結構:
# 資料分析報告
## 執行摘要
簡要說明分析的目標、主要發現和建議。
## 資料概況
- 資料來源和時間範圍
- 資料規模(行數、列數)
- 資料品質(缺失值、異常值)
## 分析方法
描述使用的分析方法和技術。
## 主要發現
列出分析中發現的重要洞察,包括:
- 統計指標
- 趨勢和模式
- 異常值或特殊情況
## 視覺化
包含相關的圖表和圖形。
## 建議和後續步驟
基於分析結果提出的建議和可能的後續行動。
## 附錄
詳細的統計表格和計算過程。
資料驗證: 始終驗證資料的品質和完整性,在進行分析前進行清理。
清晰的視覺化: 選擇適當的圖表類型,確保視覺化清晰易懂,避免過度裝飾。
統計嚴謹性: 使用適當的統計方法,並報告置信區間或 p 值等統計指標。
避免過度解釋: 不要從相關性推斷因果關係,除非有強有力的證據。
考慮背景: 將分析結果放在業務背景中解釋,提供可行的洞察。
可重現性: 記錄所有的分析步驟和參數,確保分析可以被重現。
清晰的溝通: 使用簡單的語言解釋分析結果,避免過度技術化的術語。