sn-da-large-file-analysis
仓库创建 2026年4月14日最近提交 3 天前SkillHot 收录 20 天前
▸ 精选理由
有效避免 OOM,显著提升大型表格处理性能。
▸ 风险提示
需安装相关 Python 库并有读写大文件权限。
这个 Skill 做什么
针对万行以上 Excel 提供流式读取、Parquet 转换与分块分析的高性能引擎。
当你拿到超过万行的 Excel,想要不把内存撑爆又能快读写就用它。用 openpyxl 的 read_only 做流式读取,支持把表先转成 Parquet、分块处理或走大文件写入模式,避免 pd.read_excel() 导致超时或 OOM。适合百万行级别或需要性能优化、内存受限时的场景。
▸ 展开 SKILL.md 英文原文
万行以上 Excel 数据集的高性能分析引擎。提供 openpyxl read_only 流式读取(iter_rows 支持 10 万行以上)、Parquet 转换加速、内存优化、分块处理和大文件写入模式。**遇到以下任一情况就主动使用本 skill**:①数据行数 ≥ 10k(由 sn-da-excel-workflow 的行数评估步骤触发);②用户出现触发词:大文件 / 大数据量 / 性能优化 / 内存不足 / OOM / 百万行 / 十万行 / 流式读取 / Parquet / 分块处理 / large file / big data / streaming read / chunked processing;③直接使用 pd.read_excel() 导致超时或内存溢出;④用户明确要求对大规模数据集进行高性能处理。仅不用于:小于 10k 行的常规 Excel 分析(使用 sn-da-excel-workflow 即可)。
4.8k
Stars
331
Forks
40
仓库内 Skill
+141
7 日增星
安装 / 使用
给你的 Agent 一句话(通用)
帮我安装这个 skill:https://raw.githubusercontent.com/OpenSenseNova/SenseNova-Skills/main/skills/sn-da-large-file-analysis/SKILL.md或 curl 直取 SKILL.md
curl -fsSL "https://raw.githubusercontent.com/OpenSenseNova/SenseNova-Skills/main/skills/sn-da-large-file-analysis/SKILL.md"SKILL.MD 节选查看完整文件 ↗
# Large Scale Excel Analysis Skill ## Mandatory Rules > **When total rows >= 10,000, you MUST use the methods in this skill.** | Data Scale | Read Strategy | Reason | |-----------|---------------|--------| | < 10k rows | `pd.read_excel()` directly | No memory pressure | | 10k–100k rows | `pd.read_excel()` → convert to Parquet → `pd.read_parquet()` for analysis | Avoid repeated slow reads | | 100k–1M rows | **openpyxl `read_only` + `iter_rows` streaming** → Parquet | `pd.read_excel()` will OOM or timeout | | > 1M rows | Streaming read + **multi-sheet split** (Excel max 1,048,576 rows per sheet) | Must chunk | **Prohibited:** - Do NOT use `pd.read_excel()` to fully load 100k+ row files - D
via SKILL·HOT · 数据来自 GitHub 公开信息 · 原文版权归作者所有