large-file-parquet-analysis-and-highlight
仓库创建 2026年4月14日最近提交 4 天前SkillHot 收录 20 天前
▸ 精选理由
对大表显著提速,便于提取关键指标并生成带高亮的报表。
这个 Skill 做什么
超大 Excel 文件转 Parquet 提速,计算指标并将结果回写 Excel 并高亮行。
当 Excel 行数很大(比如超过 1 万行)时,先把数据转成 Parquet 提速,再计算指标并把结果回写成带高亮的 Excel。适合需要处理超大表格、做批量聚合或找出异常行并标注的场景。特点是先统计所有 sheet 的总行数决定是否启用大文件流程,用 Parquet 提高读取性能并在输出中高亮关键行。
▸ 展开 SKILL.md 英文原文
当Excel文件总行数超过1万行时,通过转换为Parquet格式提升读取性能,提取目标指标并计算最大值,最后将结果输出为Excel并对特定行进行高亮标注。
4.8k
Stars
331
Forks
40
仓库内 Skill
+141
7 日增星
安装 / 使用
给你的 Agent 一句话(通用)
帮我安装这个 skill:https://raw.githubusercontent.com/OpenSenseNova/SenseNova-Skills/main/skills/sn-da-excel-workflow/capability/excel-cell-coloring/category-coloring/SKILL.md或 curl 直取 SKILL.md
curl -fsSL "https://raw.githubusercontent.com/OpenSenseNova/SenseNova-Skills/main/skills/sn-da-excel-workflow/capability/excel-cell-coloring/category-coloring/SKILL.md"SKILL.MD 节选查看完整文件 ↗
# Skill Steps
Step1 读取文件并统计所有 sheet 的行数,汇总后打印总行数,用于判断数据规模是否需要启用大文件处理。
```python
import pandas as pd
file_path = "input_data.xlsx"
# 读取所有sheet并统计总行数
xls = pd.ExcelFile(file_path)
sheet_names = xls.sheet_names
print(f"Sheet列表: {sheet_names}")
total_rows = 0
for sheet in sheet_names:
# 仅读取一列以加快行数统计速度
df_temp = pd.read_excel(file_path, sheet_name=sheet, usecols=[0], header=None)
rows = len(df_temp)
total_rows += rows
print(f"Sheet '{sheet}': {rows} 行")
print(f"\n总行数 = {total_rows}")
```
Step2 当总行数 ≥ 1万时,读取已转换为 Parquet 格式的数据文件,通过行列匹配提取目标指标数据,并找出最大值及其对应分类。
```python
import pandas as pd
# 假设已通过大文件处理技能将Excel转换为Parquet
parquet_path = "converted_data.parquet"
df = pd.read_pavia SKILL·HOT · 数据来自 GitHub 公开信息 · 原文版权归作者所有