word-analysis

仓库创建 2026年4月14日最近提交 3 天前SkillHot 收录 20 天前
▸ 精选理由

方便批量抽取文档结构与多文件汇总比对,适合审校与归档场景。

▸ 风险提示

旧 .doc 格式转换可能需 libreoffice 等外部工具

这个 Skill 做什么

解析 .docx/.doc 文档,提取正文、段落、表格、格式与图片 caption。

把 .docx/.doc 文档里的内容全提取出来:正文段落、表格数据、格式信息和嵌入图片的说明都能抓取并结构化输出。适合做批量文档汇总、比对或把 Word 内容导入数据库、做后续分析时用。支持保留格式和图片 caption,比简单的纯文本抽取更可靠。

▸ 展开 SKILL.md 英文原文

Word (.docx/.doc) 文档全量解析。覆盖:正文/段落文本提取、表格数据提取、高亮/颜色格式读取、多文件汇总对比、嵌入图片转 caption。

办公文档Word解析表格提取格式读取图片说明通用
4.8k
Stars
331
Forks
40
仓库内 Skill
+141
7 日增星
安装 / 使用
给你的 Agent 一句话(通用)
帮我安装这个 skill:https://raw.githubusercontent.com/OpenSenseNova/SenseNova-Skills/main/skills/sn-da-non-spreadsheet-analysis/capability/word-analysis/SKILL.md
或 curl 直取 SKILL.md
curl -fsSL "https://raw.githubusercontent.com/OpenSenseNova/SenseNova-Skills/main/skills/sn-da-non-spreadsheet-analysis/capability/word-analysis/SKILL.md"
SKILL.MD 节选查看完整文件 ↗
# Word Analysis — .docx / .doc

## Environment

```python
from docx import Document
import os

# python-docx is available; for .doc (old format) convert via libreoffice first
def load_doc(path):
    """Load .docx directly; convert .doc to .docx first if needed."""
    if path.lower().endswith('.doc'):
        import subprocess
        out_dir = os.path.dirname(path)
        subprocess.run(
            ['libreoffice', '--headless', '--convert-to', 'docx', '--outdir', out_dir, path],
            check=True, capture_output=True
        )
        path = path.rsplit('.', 1)[0] + '.docx'
    return Document(path)
```

---

## Core Method 1: Full Text Extraction

```python
def extract_full_text(doc
via SKILL·HOT · 数据来自 GitHub 公开信息 · 原文版权归作者所有