AI 大型語言模型 (LLMs)

AXIOM

AXIOM 是一個可啟動的 Rust 核心,透過以推論專用原語取代通用作業系統抽象,最佳化 Transformer 推論。

什麼是 AXIOM?

AXIOM 是一個研究用作業系統核心,專門設計用來在記憶體受限的硬體上有效執行 Transformer 推論工作負載,使用張量原生配置、層邊界排程和雙緩衝權重串流。

AXIOM 與相似工具比較

計價模式免費免費免費免費
免費額度
主要功能
  • 張量原生記憶體配置,使用預留池
  • 層邊界排程以防止層間搶佔
  • 雙緩衝權重串流以重疊 I/O 和計算
  • 原生載入 DeepSeek V4、Qwen3.6 和 GLM 5.2 模型
  • 針對記憶體受限系統的自適應 Metal 駐留與 SSD 串流
  • 具備工具呼叫與編碼代理的 HTTP 伺服器
  • 使用 Project Panama FFM API 的零分配推理
  • LLM、ASR、TTS 和多模態模型的統一運行時
  • 進程全局後端以消除 VRAM 碎片
  • 純 C 實作,零外部依賴
  • 從磁碟串流專家權重,具備 LRU 快取與可選的固定熱儲存
  • 忠於 GLM-5.2 (glm_moe_dsa) 的前向傳遞,經驗證 token 完全一致
優點
  • 將每層串流開銷從數秒減少到微秒
  • 針對可預測的推論存取模式最佳化記憶體佈局
  • 完全本地運行,確保資料隱私
  • 針對 Apple Silicon 最佳化,搭配 Metal 加速
  • 零分配設計,在 Java 中實現高效能
  • 跨多種模型類型(文字、視覺、音訊)的統一 API
  • 在僅 25 GB RAM 的消費級硬體上運行 744B 參數模型
  • 開源且完全透明(C 程式碼,無依賴)
缺點
  • 目前限於特定模型 (SmolLM2-135M, TinyLlama-1.1B Q4)
  • 需要裸機 NVMe 以進行預期的低記憶體 7B 類評估
  • 主要為 Apple Silicon 設計;CUDA/ROCm 後端為次要
  • 非通用 GGUF 執行器,僅支援特定模型
  • 需要 Java 22+ 和 Project Panama(尚未在所有 JVM 中標準化)
  • 由於原生編譯,初學者的建置過程可能較複雜
  • 冷解碼速度極慢(一般 NVMe 上約 0.05-0.1 tok/s)
  • 轉換後的 int4 模型需要約 370 GB 磁碟空間
適合對象
  • AI 系統和作業系統的研究人員
  • 在受限硬體上最佳化推論的開發人員
  • 希望進行裝置端 LLM 推論的 Apple Silicon Mac 使用者
  • 尋求專門高效能推論引擎的開發者
  • 構建低記憶體開銷 AI 應用程式的 Java 開發人員
  • 需要本地端、高吞吐量推理的 LLM 和多模態模型專案
  • 希望在本機運行大型模型的開發者
  • 在有限硬體上探索 MoE 架構的 AI 研究人員

如何使用 AXIOM?

  1. 1設定 Rust nightly 工具鏈並安裝 bootimage。
  2. 2使用提供的 Python 腳本 (pack_weights.py) 打包模型權重。
  3. 3使用 cargo +nightly run --release 建置核心。
  4. 4在 QEMU 或裸機上啟動核心;它將執行推論並輸出遙測資料。

AXIOM 主要功能

  • 張量原生記憶體配置,使用預留池
  • 層邊界排程以防止層間搶佔
  • 雙緩衝權重串流以重疊 I/O 和計算
  • LayerLock 排程器用於快取駐留執行
  • 量化推論 (Q4) 用於 SmolLM2-135M 和 TinyLlama-1.1B

AXIOM 使用情境

  • 在記憶體受限的系統上執行大型語言模型
  • 最佳化 Transformer 模型的推論延遲
  • 研究 AI 工作負載的作業系統層級最佳化
  • 評估核心層級排程對推論吞吐量的影響

AXIOM 價格與免費點數

AXIOM 目前採用 免費 模式。

開放原始碼

免費

AXIOM 在 GitHub 上以開放原始碼授權提供。

AXIOM 優缺點

優點

  • 將每層串流開銷從數秒減少到微秒
  • 針對可預測的推論存取模式最佳化記憶體佈局
  • 開放原始碼且可擴展以供研究
  • 在基準測試中展示顯著的吞吐量提升 (14.8倍 TPS)

缺點

  • 目前限於特定模型 (SmolLM2-135M, TinyLlama-1.1B Q4)
  • 需要裸機 NVMe 以進行預期的低記憶體 7B 類評估
  • 計算核心 (FFN 投影) 仍是瓶頸
  • 非通用作業系統;缺乏使用者空間、網路、檔案系統

AXIOM 最適合哪些用途?

  • AI 系統和作業系統的研究人員
  • 在受限硬體上最佳化推論的開發人員
  • 對 AI 核心層級效能工程感興趣的工程師

AXIOM 常見問題

AXIOM 的免費替代工具

Opper AI logo

統一的AI閘道,透過一個符合GDPR的歐盟託管API,提供對300多種領先模型的存取,並相容於OpenAI SDK。

免費
discode.ai logo

一個聊天介面,讓您存取超過100個AI模型,自動為您的任務選擇最佳模型,同時追蹤能源使用並保護您的隱私。

免費
Oxlo.ai logo

Oxlo.ai 是一個隱私優先的 AI 推論 API,為超過 45 個開源模型提供按請求計價的方案。

免費
Graphsignal logo

Graphsignal 是一個生產規模的推論剖析平台,協助工程師在各種模型、引擎、GPU 及其他加速器上優化 AI 效能。

免費

AXIOM 的最佳替代 AI 工具

DwarfStar logo

專為大型語言模型設計的本地推論引擎,針對 Apple Silicon 及記憶體受限系統上的 SSD 串流進行最佳化。

LibArgus logo

統一的零分配原生 AI 推理運行時,適用於 Java,通過 Project Panama 整合 LLM、視覺和語音管道。

colibri logo

一個無依賴的 C 引擎,從磁碟串流專家權重,可在消費級硬體上以僅 25 GB RAM 運行 744B 參數的 GLM-5.2 MoE 模型。

Opper AI logo

統一的AI閘道,透過一個符合GDPR的歐盟託管API,提供對300多種領先模型的存取,並相容於OpenAI SDK。

免費
Auriko logo

一個統一的 API 平台,用於 LLM 推理,具備成本最佳化、路由、可觀測性和自動故障轉移功能。

L

一款基於瀏覽器的工具,運用雅可比透鏡即時讀取語言模型的內部概念。

Frugon logo

Frugon 是一個免費、開源的 LLM 成本分析工具,透過本地分析通話記錄,找出你的 LLM 帳單漏洞。