AI 大语言模型 (LLM)

AXIOM

AXIOM 是一个可引导的 Rust 内核,通过用推理专用原语替换通用操作系统抽象来优化 Transformer 推理。

什么是 AXIOM?

AXIOM 是一个研究操作系统内核,专门设计用于在内存受限硬件上高效运行 Transformer 推理工作负载,采用张量原生分配、层边界调度和双缓冲权重流。

AXIOM 与相似工具比较

计价模式免费免费免费免费
免费额度
主要功能
  • 张量原生内存分配,带预保留池
  • 层边界调度,防止中层抢占
  • 双缓冲权重流,重叠 I/O 和计算
  • 原生加载DeepSeek V4、Qwen3.6和GLM 5.2模型
  • 自适应Metal驻留和SSD流式处理,适用于内存受限系统
  • 支持工具调用和编码代理的HTTP服务器
  • 使用Project Panama FFM API实现零分配推理
  • 统一的LLM、ASR、TTS和多模态模型运行时
  • 进程全局后端消除VRAM碎片
  • 纯C实现,零外部依赖
  • 从磁盘流式传输专家权重,带有LRU缓存和可选的热存储固定
  • 忠实的GLM-5.2(glm_moe_dsa)前向传播,验证为令牌精确
优点
  • 将每层的流传输开销从秒级降低到微秒级
  • 优化内存布局,适应可预测的推理访问模式
  • 完全本地运行,确保数据隐私
  • 针对Apple Silicon优化,支持Metal加速
  • Java中零分配设计实现高性能
  • 跨多种模型类型(文本、视觉、音频)的统一API
  • 在仅25 GB RAM的消费级硬件上运行744B参数模型
  • 开源且完全透明(C代码,无依赖)
缺点
  • 目前仅支持特定模型(SmolLM2-135M, TinyLlama-1.1B Q4)
  • 需要裸机 NVMe 以实现预期的低内存 7B 类评估
  • 主要为Apple Silicon设计;CUDA/ROCm后端为次要
  • 不是通用的GGUF运行器,仅支持特定模型
  • 需要Java 22+和Project Panama(并非所有JVM都默认支持)
  • 由于原生编译,构建过程对新手可能较复杂
  • 冷解码速度极慢(典型NVMe上0.05-0.1 tok/s)
  • 需要约370 GB磁盘空间存放转换后的int4模型
适合对象
  • AI 系统和操作系统领域的研究人员
  • 在受限硬件上优化推理的开发者
  • 希望进行设备端LLM推理的Apple Silicon Mac用户
  • 寻求专用高性能推理引擎的开发者
  • 构建低内存开销AI应用的Java开发者
  • 需要本地化、高吞吐量LLM和多模态模型推理的项目
  • 希望本地运行大规模模型的开发者
  • 在有限硬件上探索MoE架构的AI研究人员

如何使用 AXIOM?

  1. 1设置 Rust nightly 工具链并安装 bootimage。
  2. 2使用提供的 Python 脚本 (pack_weights.py) 打包模型权重。
  3. 3使用 cargo +nightly run --release 构建内核。
  4. 4在 QEMU 或裸机上启动内核;它将执行推理并输出遥测数据。

AXIOM 主要功能

  • 张量原生内存分配,带预保留池
  • 层边界调度,防止中层抢占
  • 双缓冲权重流,重叠 I/O 和计算
  • LayerLock 调度器,用于缓存驻留执行
  • SmolLM2-135M 和 TinyLlama-1.1B 的量化推理 (Q4)

AXIOM 使用场景

  • 在内存受限系统上运行大型语言模型
  • 优化 Transformer 模型的推理延迟
  • 研究 AI 工作负载的操作系统级优化
  • 评估内核级调度对推理吞吐量的影响

AXIOM 价格与免费额度

AXIOM 目前采用 免费 模式。

此工具完全免费使用

开源

免费

AXIOM 在 GitHub 上以开源许可证提供。

AXIOM 优缺点

优点

  • 将每层的流传输开销从秒级降低到微秒级
  • 优化内存布局,适应可预测的推理访问模式
  • 开源且可扩展,适合研究
  • 在基准测试中显示出显著的吞吐量提升(14.8x TPS)

缺点

  • 目前仅支持特定模型(SmolLM2-135M, TinyLlama-1.1B Q4)
  • 需要裸机 NVMe 以实现预期的低内存 7B 类评估
  • 计算内核(FFN 投影)仍然是瓶颈
  • 非通用操作系统;缺少用户空间、网络、文件系统

AXIOM 最适合哪些用途?

  • AI 系统和操作系统领域的研究人员
  • 在受限硬件上优化推理的开发者
  • 对 AI 内核级性能工程感兴趣的工程师

AXIOM 常见问题

AXIOM 的免费替代工具

Opper AI logo

一个统一的AI网关,通过一个欧盟托管、符合GDPR的API提供300多个领先模型的访问,并兼容OpenAI SDK的接口。

免费
discode.ai logo

一个聊天气泡界面,即可访问超过100个AI模型,自动为您的任务选择最佳模型,同时跟踪能源使用并保护您的隐私。

免费
Oxlo.ai logo

Oxlo.ai 是一个隐私优先的 AI 推理 API,为超过 45 个开源模型提供按请求计费的定价。

免费
Graphsignal logo

Graphsignal 是一个生产级推理性能分析平台,帮助工程师跨模型、引擎、GPU 及其他加速器优化 AI 性能。

免费

AXIOM 的最佳替代 AI 工具

DwarfStar logo

一个专门用于大型语言模型的本地推理引擎,针对Apple Silicon和内存受限系统上的SSD流式处理进行了优化。

LibArgus logo

统一的零分配原生AI推理运行时,专为Java设计,通过Project Panama整合LLM、视觉和语音管道。

colibri logo

一个无依赖的C引擎,从磁盘流式传输专家权重,以在消费级硬件上运行744B参数的GLM-5.2 MoE模型,仅需25 GB RAM。

Opper AI logo

一个统一的AI网关,通过一个欧盟托管、符合GDPR的API提供300多个领先模型的访问,并兼容OpenAI SDK的接口。

免费
Auriko logo

用于LLM推理的统一API平台,具有成本优化、路由、可观测性和自动故障转移功能。

L

一款基于浏览器的工具,利用雅可比透镜实时读取语言模型的内部概念。

Frugon logo

Frugon 是一个免费、开源的 LLM 成本分析工具,通过本地分析您的调用日志,识别出您的 LLM 账单在哪里产生不必要的花费。