ray-data
仓库创建 2026年3月17日最近提交 2 个月前SkillHot 收录 20 天前
▸ 精选理由
支持多模态与分布式流水线,适合大规模数据准备
▸ 风险提示
集群部署可能涉及网络与权限配置或产生云端费用
这个 Skill 做什么
用于机器学习的分布式数据处理与预处理,可扩展至集群。
做机器学习用的分布式数据处理和预处理,支持 Parquet/CSV/JSON、图片等,多节点上做流式或批量处理并能跑在 CPU/GPU 上。用在大规模数据预处理、批量推理、多模态数据加载或分布式 ETL 场景。特点是可从单机扩到上百节点,并能和 Ray Train、PyTorch、TensorFlow 无缝集成。
▸ 展开 SKILL.md 英文原文
Scalable data processing for ML workloads. Streaming execution across CPU/GPU, supports Parquet/CSV/JSON/images. Integrates with Ray Train, PyTorch, TensorFlow. Scales from single machine to 100s of nodes. Use for batch inference, data preprocessing, multi-modal data loading, or distributed ETL pipelines.
1.5k
Stars
104
Forks
16
仓库内 Skill
+0
7 日增星
安装 / 使用
给你的 Agent 一句话(通用)
帮我安装这个 skill:https://raw.githubusercontent.com/OpenRaiser/NanoResearch/main/skills/vendor-ai-research/ray-data/SKILL.md或 curl 直取 SKILL.md
curl -fsSL "https://raw.githubusercontent.com/OpenRaiser/NanoResearch/main/skills/vendor-ai-research/ray-data/SKILL.md"SKILL.MD 节选查看完整文件 ↗
# Ray Data - Scalable ML Data Processing Distributed data processing library for ML and AI workloads. ## When to use Ray Data **Use Ray Data when:** - Processing large datasets (>100GB) for ML training - Need distributed data preprocessing across cluster - Building batch inference pipelines - Loading multi-modal data (images, audio, video) - Scaling data processing from laptop to cluster **Key features**: - **Streaming execution**: Process data larger than memory - **GPU support**: Accelerate transforms with GPUs - **Framework integration**: PyTorch, TensorFlow, HuggingFace - **Multi-modal**: Images, Parquet, CSV, JSON, audio, video **Use alternatives instead**: - **Pandas**: Small data
via SKILL·HOT · 数据来自 GitHub 公开信息 · 原文版权归作者所有