vision-model-batch-extraction

仓库创建 2026年7月26日最近提交 4 天前SkillHot 收录 3 天前
这个 Skill 做什么

用本地视觉模型把排版复杂的 PDF(比如左右两栏:单词+释义)逐页识别成结构化条目,再批量生成 Word 文档。当 pdfminer、pymupdf 等文本提取工具因为表格或双栏失败时派上用场。特点是先把页转图再用视觉模型识别,能保留条目顺序和分组输出。

▸ 展开 SKILL.md 英文原文

使用本地视觉模型从PDF批量提取结构化数据(单词+释义),生成Word文档。适用于标准文本提取工具因表格排版失败时的场景。

0
Stars
0
Forks
9
仓库内 Skill
+0
7 日增星
安装 / 使用
给你的 Agent 一句话(通用)
帮我安装这个 skill:https://raw.githubusercontent.com/jim-688/hermes-config/main/skills/vision-model-batch-extraction/SKILL.md
或 curl 直取 SKILL.md
curl -fsSL "https://raw.githubusercontent.com/jim-688/hermes-config/main/skills/vision-model-batch-extraction/SKILL.md"
SKILL.MD 节选查看完整文件 ↗
# 视觉模型批量结构化提取 & 通用 Word 文档生成

涵盖两大场景:
1. **PDF批量提取**(主场景):将双栏排版PDF逐页转图后,用本地Ollama视觉模型批量提取结构化数据,生成分组Word文档。
2. **通用Word生成**(辅助场景):从零创建Word文档(自我介绍、简历、报告等),无需PDF源,直接通过python-docx脚本生成。

## 适用场景

- PDF是双栏表格排版(左栏单词、右栏释义)
- 标准文本提取工具(pdfminer、pymupdf.get_text)因排版复杂提取不全
- 需要保持条目顺序和分组(如每天60词)

## 完整流程

### Step 1:PDF转图
```bash
pip install pymupdf
python -c "
import fitz, os
doc = fitz.open('book.pdf')
os.makedirs('img', exist_ok=True)
for i in range(len(doc)):
    doc[i].get_pixmap(dpi=150).save(f'img/p{i+1}.png')
doc.close()
"
```

### Step 2:Ollama视觉API调用
```python
with open('page.png', 'rb') as f:
    img_b64 = base64.b64encode(f.read()).decode()

data = json.dumps({
    'model': 'huihui_ai/qwen2.5
via SKILL·HOT · 数据来自 GitHub 公开信息 · 原文版权归作者所有