radixark/miles
Miles is an enterprise-facing reinforcement learning framework for LLM and VLM post-training, forked from and co-evolving with slime.
🤖 深度介绍
它是什么
Miles 是一个面向企业级场景的强化学习(RL)框架,专为 LLM 与 VLM 的后训练阶段设计。它源自 slime 项目的分支,并与上游保持协同演进,目前已在 GitHub 上积累 2.5k+ stars。
核心亮点
- 企业级设计:针对生产环境优化,支持大规模分布式训练与稳定部署
- 双模态覆盖:同时支持文本(LLM)与视觉-语言(VLM)模型的 RL 微调
- 与 slime 协同:继承成熟架构,同时持续吸收社区改进,保持技术前沿性
- Apache-2.0 许可:商业友好,无使用限制
为什么火
RLHF 已成为大模型后训练的关键环节,但现有框架多停留在学术原型阶段。Miles 精准切入“企业可用”这一痛点,将研究代码转化为可落地的工业级工具。其与 slime 的共生关系也吸引了关注生态演进的开发者,近 55 个日增 stars 印证了需求的真实性。
适合谁用
- 需要将 RL 流程接入生产环境的 AI 工程团队
- 从事 LLM/VLM 对齐研究、希望快速实验的算法工程师
- 对开源 RL 框架演进路径感兴趣的技术决策者
快速上手
# 安装
pip install miles-rl
# 基本用法(伪代码)
from miles import RLConfig, post_train
config = RLConfig(model_name="your-base-model", rl_algorithm="ppo")
post_train(config, dataset="alignment-dataset.jsonl")
完整配置与分布式启动脚本见项目 examples/ 目录,支持 PyTorch 生态原生集成。
