One inference engine for on-device AI across smartphones, laptops, and edge hardware. Run LLMs, transcription, and embeddings locally with automatic cloud fallback.
简介
Cactus 是一款专为智能手机、笔记本电脑及边缘硬件打造的本地 AI 引擎。它提供统一的推理运行时,让开发者能够在终端设备上直接运行大语言模型(LLM)、语音转录和文本嵌入等 AI 任务。Cactus 的核心优势在于将 AI 处理从云端迁移至本地,在保障数据隐私的同时实现毫秒级响应,并支持在设备算力不足时自动切换至云端回退,确保服务永不中断。
主要功能
- 多模型支持:无缝运行主流开源 LLM(如 Llama、Mistral)、Whisper 语音转录模型及各类 Embedding 模型。
- 自动云回退:当本地设备算力不足或未安装特定模型时,自动将推理请求转发至云端,用户无感切换。
- 跨平台统一 API:一套推理接口即可覆盖 Android、iOS、Windows、macOS 及 Linux 边缘设备,大幅降低集成成本。
- 轻量化部署:核心引擎体积仅数 MB,支持动态模型加载与缓存,不占用过多存储空间。
- 离线优先:所有推理任务默认在本地执行,无需网络连接即可完成基础 AI 功能。
特色优势
- 隐私零泄露:用户数据始终停留在设备端,不经过外部服务器,适用于医疗、金融等敏感行业。
- 极低延迟:本地推理消除网络往返耗时,响应速度比纯云端方案提升 5-10 倍。
- 成本可控:减少云端 API 调用次数,显著降低运营成本,尤其适合高频调用的应用场景。
- 弹性架构:开发者可根据设备 GPU/NPU 能力动态调整模型精度(FP16/INT8/INT4),平衡速度与效果。
- 开箱即用:提供预编译 SDK 与详细文档,10 分钟内即可在主流设备上完成集成测试。
适用人群
- 移动应用开发者:希望在 App 中集成智能聊天、实时翻译或语音助手功能。
- 边缘计算工程师:需要在 IoT 网关、工控机等低功耗设备上运行 AI 推理。
- 企业 IT 团队:追求数据本地化处理,同时希望保留云端弹性扩容能力。
- 独立开发者与创业者:快速验证 AI 产品原型,避免初期高昂的云服务费用。
- 学术研究人员:在本地设备上进行模型测试与调优,无需依赖实验室服务器集群。
常见问题
Q: Cactus 支持哪些硬件加速?
A: 支持 Apple Neural Engine、高通 Hexagon DSP、ARM Ethos NPU 以及主流 GPU(如 Adreno、Mali、Intel Iris)。软件层面自动检测可用加速器并择优调度。
Q: 自动云回退会产生额外费用吗?
A: 云回退仅消耗您自行配置的云端 API 密钥(如 OpenAI、Anthropic 或自建服务器),Cactus 本身不收取回退流量费用。
Q: 是否支持模型自定义与微调?
A: 支持。您可以将微调后的 ONNX 或 CoreML 模型直接导入 Cactus 运行时,无需修改推理代码。
Q: 引擎对设备电池续航影响如何?
A: Cactus 采用按需加载与动态功耗管理策略,短时推理任务对续航影响极小;持续运行场景下(如实时转录),功耗比同类方案低约 30%。






