slime-rl-training
连接Megatron-LM与SGLang的RL后训练框架,适配GLM系列模型的高吞吐生成。
相关性达标的全量 Skills(含未精选长尾)· 共 8087 个
连接Megatron-LM与SGLang的RL后训练框架,适配GLM系列模型的高吞吐生成。
无参考模型的偏好优化方法,作为DPO的高效替代用于对齐训练。
基于Ray和vLLM的高性能分布式RLHF训练框架,支持PPO/GRPO/DPO等。
面向大规模MoE模型与低精度训练(FP8/INT4)的企业级RL训练指南。
使用TRL实现GRPO策略优化的实战级训练与调参指南。
面向ML的可扩展分布式数据处理框架,支持Parquet、流式与多模态数据。
基于GPU的多模态训练数据治理与过滤,支持模糊/语义去重和PII/NSFW检测。
使用 TransformerLens 检查并操作 Transformer 内部激活与注意力以做可解释性研究。
使用 SAELens 训练与分析稀疏自编码器以发现可解释神经特征。
用 pyvene 的声明式框架对 PyTorch 模型执行因果干预与激活补丁实验。
用 nnsight 在本地或通过 NDIF 远程运行对 PyTorch 模型做可解释性分析。
提供 Unsloth 的快速微调与显存/速度优化方案与实践。
用 PEFT/LoRA 等方法对大模型进行参数高效微调的实践与示例。
面向 LLaMA-Factory 的无代码 WebUI 微调与模型管理指导。
提供 Axolotl 的微调流程、YAML 配置与方法(LoRA/QLoRA 等)。
语言无关的分词器,直接在原始 Unicode 文本上训练 BPE 或 Unigram 词表。
Rust 实现的高性能分词器,支持 BPE/WordPiece/Unigram 与自训练词表。
提供基于 PyTorch 的 4D 并行分布式 LLM 预训练平台(TorchTitan)。
约 300 行简洁实现的 GPT 教学代码,便于学习与实验复现。
以两环(实验-综合)架构自动编排完整的 AI 研究生命周期。
按中大型互联网公司风格模拟 Java 后端技术面试并提供评分与反馈。
提供 Claude show_widget 的完整设计系统与生成可视化组件的指南。
从投资人、求职者与创始人三种视角对初创公司进行多维度分析。
从 yc-oss API 拉取 Y Combinator 公司与批次的公开数据用于研究。
通过 opencli 只读访问 Twitter/X,用于抓取推文、搜索与舆情分析。
使用 tdl 读取 Telegram 频道/群组的金融新闻与消息导出(只读)。
opencli 的通用只读适配器,覆盖 90+ 站点的数据抓取
用 opencli 只读抓取 LinkedIn 内容供金融与职业研究
使用 opencli 只读方式抓取 Discord 频道与消息用于研究
创建、评估并迭代 agent skills 的全流程工具
通过 yfinance 获取股票历史数据、财报与期权链
评估股票流动性、买卖差价及市场冲击成本
基于历史价格数据找出相关股票和交易配对
基于Mark Minervini的SEPA方法分析成长股入场与风控
分析 SaaS 公司在各轮融资间基于 ARR 的估值倍数压缩或扩张原因。
生成交互式期权到期/理论价格收益曲线并可调整参数实时查看。
计算 ETF 市场价与 NAV 的溢价/折价并分解单日差异成因。
深入分析分析师 EPS/营收预测及修订趋势并量化分布与动量。
使用 Yahoo Finance 数据生成财报后的结果分析、惊喜与股价反应总结。
基于 Yahoo Finance 数据生成股票财报前的简报,包含预期、历史表现与分析要点。