AI 大语言模型 (LLM)
AXIOM
AXIOM 是一个可引导的 Rust 内核,通过用推理专用原语替换通用操作系统抽象来优化 Transformer 推理。
AXIOM
什么是 AXIOM?
AXIOM 是一个研究操作系统内核,专门设计用于在内存受限硬件上高效运行 Transformer 推理工作负载,采用张量原生分配、层边界调度和双缓冲权重流。
AXIOM 与相似工具比较
| 计价模式 | 免费 | 免费 | 免费 | 免费 |
| 免费额度 | ||||
| 主要功能 |
|
|
|
|
| 优点 |
|
|
|
|
| 缺点 |
|
|
|
|
| 适合对象 |
|
|
|
|
如何使用 AXIOM?
- 1设置 Rust nightly 工具链并安装 bootimage。
- 2使用提供的 Python 脚本 (pack_weights.py) 打包模型权重。
- 3使用 cargo +nightly run --release 构建内核。
- 4在 QEMU 或裸机上启动内核;它将执行推理并输出遥测数据。
AXIOM 主要功能
- 张量原生内存分配,带预保留池
- 层边界调度,防止中层抢占
- 双缓冲权重流,重叠 I/O 和计算
- LayerLock 调度器,用于缓存驻留执行
- SmolLM2-135M 和 TinyLlama-1.1B 的量化推理 (Q4)
AXIOM 使用场景
- 在内存受限系统上运行大型语言模型
- 优化 Transformer 模型的推理延迟
- 研究 AI 工作负载的操作系统级优化
- 评估内核级调度对推理吞吐量的影响
AXIOM 价格与免费额度
AXIOM 目前采用 免费 模式。
此工具完全免费使用
AXIOM 优缺点
优点
- 将每层的流传输开销从秒级降低到微秒级
- 优化内存布局,适应可预测的推理访问模式
- 开源且可扩展,适合研究
- 在基准测试中显示出显著的吞吐量提升(14.8x TPS)
缺点
- 目前仅支持特定模型(SmolLM2-135M, TinyLlama-1.1B Q4)
- 需要裸机 NVMe 以实现预期的低内存 7B 类评估
- 计算内核(FFN 投影)仍然是瓶颈
- 非通用操作系统;缺少用户空间、网络、文件系统
AXIOM 最适合哪些用途?
- AI 系统和操作系统领域的研究人员
- 在受限硬件上优化推理的开发者
- 对 AI 内核级性能工程感兴趣的工程师