group-by-analysis
仓库创建 2026年4月14日最近提交 4 天前SkillHot 收录 20 天前
▸ 精选理由
涵盖合并单元格、正则清洗与分类映射,适合处理复杂表格数据。
这个 Skill 做什么
对多Sheet Excel 做清洗、分组聚合并生成样式化统计表与可视化。
处理多 Sheet Excel 报表或大表清洗分析时用,能做合并单元格前向填充、正则清洗、分类映射、分组聚合等预处理。支持把大文件转成 Parquet 做后续分析,并生成带样式的统计表和可视化图表便于汇报。适合财务和数据同学合并多来源表格时大幅提速和降错。
▸ 展开 SKILL.md 英文原文
对多 Sheet 的 Excel 文件进行行数统计、大文件 Parquet 转换预处理、数据清洗及分组聚合分析,并生成带样式标记的统计表与可视化图表。
4.8k
Stars
331
Forks
40
仓库内 Skill
+141
7 日增星
安装 / 使用
给你的 Agent 一句话(通用)
帮我安装这个 skill:https://raw.githubusercontent.com/OpenSenseNova/SenseNova-Skills/main/skills/sn-da-excel-workflow/capability/excel-data-analysis/group-by-analysis/SKILL.md或 curl 直取 SKILL.md
curl -fsSL "https://raw.githubusercontent.com/OpenSenseNova/SenseNova-Skills/main/skills/sn-da-excel-workflow/capability/excel-data-analysis/group-by-analysis/SKILL.md"SKILL.MD 节选查看完整文件 ↗
Step1 对数据进行清洗与预处理,包括处理合并单元格、正则过滤以及分类映射。
```python
import re
# 1. 处理合并单元格:向前填充
target_col = 'category_column'
df[target_col] = df[target_col].ffill()
# 2. 正则清洗:去除无效字符或筛选特定格式
def clean_text(text):
if pd.isna(text): return text
return re.sub(r'[^\w\s]', '', str(text)).strip()
df[target_col] = df[target_col].apply(clean_text)
# 3. 分类映射函数骨架
def map_categories(value):
mapping = {
'example_key_1': 'Group_A',
'example_key_2': 'Group_B'
}
return mapping.get(value, 'Others')
df['group_tag'] = df[target_col].apply(map_categories)
```
Step2 执行分组统计,计算频数、占比,并添加总计行。
```python
group_col = 'group_tag'
value_col = 'value_column'
# 分组聚合:计数与求和
summary = df.groupby(grouvia SKILL·HOT · 数据来自 GitHub 公开信息 · 原文版权归作者所有