oMLX — LLM inference, optimized for your Mac
4.0A native macOS inference server built on MLX. Paged SSD KV caching drops agent TTFT from 30-90s to under 5s. OpenAI & Anthropic compatible API for Apple Silicon.
最后更新 2026 年 7 月 6 日
简介
oMLX 是一款专为 macOS 设计的原生推理服务器,基于 Apple MLX 框架构建,旨在充分发挥 Apple Silicon 芯片的深度学习计算潜力。无论是运行大型语言模型(LLM)还是构建智能代理应用,oMLX 都能提供高效、低延迟的本地推理体验。通过创新的 Paged SSD KV 缓存技术,oMLX 将代理任务的首 token 生成时间(TTFT)从传统的 30-90 秒大幅压缩至 5 秒以内,让本地 AI 应用真正实现“开箱即用”。同时,oMLX 提供与 OpenAI 及 Anthropic 兼容的 API 接口,方便开发者无缝迁移现有项目。
主要功能
原生 macOS 推理引擎:深度优化 Apple Silicon 统一内存架构,支持 M1/M2/M3 系列芯片,无需额外 GPU 或加速卡。
Paged SSD KV 缓存:突破内存限制,将长上下文推理中的键值缓存分页存储至 SSD,显著降低首 token 延迟,适合多轮对话与复杂代理场景。
兼容 OpenAI / Anthropic API:提供标准 RESTful 接口,支持 Chat Completions、Embeddings 等主流端点,一行代码即可切换本地模型。
热加载与模型管理:支持动态加载/卸载模型,无需重启服务,便于测试不同量化版本或微调模型。
轻量级部署:单二进制文件,无复杂依赖,通过 Homebrew 或手动下载即可在几分钟内完成安装。
定价与费用
- 极速首 token 响应:Paged SSD 缓存技术让代理类应用(如代码助手、多步推理)的等待时间从分钟级降至秒级,用户体验大幅提升。
- 完全本地隐私:所有推理在本地完成,数据不出设备,适合处理敏感信息或离线环境。
- 零配置兼容:直接使用 OpenAI SDK 或 Anthropic SDK 连接 oMLX,无需修改现有代码逻辑,降低迁移成本。
- 高效资源利用:针对 Apple Silicon 的 Metal 后端进行指令级优化,在同等功耗下提供更高吞吐量,延长 MacBook 电池续航。
- 活跃社区与文档:开源项目,提供详尽的配置指南、性能基准及常见问题解答,持续迭代支持最新模型架构。
适用人群
- AI 应用开发者:需要快速构建本地 LLM 驱动的工具(如智能客服、文档分析、代码生成),并希望控制推理成本与延迟。
- 隐私敏感用户:企业或个人在处理医疗、法律、金融等数据时,要求所有推理运算在本地完成,避免云端传输风险。
- macOS 性能爱好者:希望充分利用 Apple Silicon 硬件潜力,在本地运行主流开源模型(如 LLaMA、Mistral、Phi)的 Mac 用户。
- 研究与原型设计:需要快速验证多轮对话或代理工作流,且不想受限于云端 API 速率限制或网络不稳定性的研究人员。