基于 SOC 职业分类
用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
直接命令不会经过审查 Prompt;运行前请先检查来源。
npx skills add https://github.com/ptreezh/sscisubagent-skills --skill processing-network-data命令会保持在同一行。复制前请横向滚动并检查完整内容。
想先保存到本地?可下载 SkillsMP 当前能够提供的文件。
正在显示 SKILL.md
| name | processing-network-data |
| description | 处理社会网络数据,包括关系数据收集、矩阵构建、数据清洗验证和多模网络处理。当需要从问卷、访谈、观察或数字记录中提取关系数据,构建标准化的网络矩阵时使用此技能。 |
专门用于社会网络研究的数据收集和预处理,将原始关系数据转换为标准化的网络分析格式。
当用户提到以下需求时,使用此技能:
识别数据来源类型
数据格式标准化
数据导入和初步检查
# 示例:不同格式数据的导入
if data_format == 'excel':
df = pd.read_excel(file_path)
elif data_format == 'csv':
df = pd.read_csv(file_path, encoding='utf-8')
elif data_format == 'json':
with open(file_path, 'r', encoding='utf-8') as f:
data = json.load(f)
问卷关系提取
访谈文本关系挖掘
# 从访谈文本中提取关系
def extract_relationships_from_text(text):
# 使用正则表达式和关键词匹配
relationship_patterns = [
r'(\w+)\s*[和|与]\s*(\w+)\s*[是|为|有].*关系',
r'(\w+)\s*[认识|了解]\s*(\w+)',
r'(\w+)\s*[向|对]\s*(\w+)\s*[寻求|请求].*帮助'
]
relationships = []
for pattern in relationship_patterns:
matches = re.findall(pattern, text)
relationships.extend(matches)
return relationships
观察数据关系编码
数字数据关系挖掘
确定节点列表
# 构建完整的节点列表
def create_node_list(relationship_data):
nodes = set()
for rel in relationship_data:
nodes.add(rel['source'])
nodes.add(rel['target'])
return sorted(list(nodes))
构建邻接矩阵
# 构建邻接矩阵
def build_adjacency_matrix(nodes, relationships, weighted=False):
n = len(nodes)
adjacency_matrix = np.zeros((n, n))
node_index = {node: i for i, node in enumerate(nodes)}
for rel in relationships:
i = node_index[rel['source']]
j = node_index[rel['target']]
if weighted:
adjacency_matrix[i][j] = rel.get('weight', 1)
else:
adjacency_matrix[i][j] = 1
if not rel.get('directed', False):
adjacency_matrix[j][i] = 1
return adjacency_matrix
处理特殊网络类型
缺失值处理
异常值检测
# 异常关系检测
def detect_outlier_relationships(adjacency_matrix, threshold=3):
degrees = np.sum(adjacency_matrix, axis=1)
mean_degree = np.mean(degrees)
std_degree = np.std(degrees)
outliers = []
for i, degree in enumerate(degrees):
if abs(degree - mean_degree) > threshold * std_degree:
outliers.append(i)
return outliers
数据一致性检查
质量评估指标
节点属性整合
边属性处理
时间属性编码
问题:问卷数据格式不统一
问题:访谈文本关系识别困难
问题:数据质量参差不齐
问题:多源数据整合困难
高质量的网络数据处理应该:
此技能为中文社会科学网络研究提供全面的数据处理支持,确保从原始数据到标准化网络文件的准确转换。