AI 大型語言模型 (LLMs)

NanoEuler

NanoEuler 是一個完全用 C/CUDA 從頭建構的開源 GPT-2 風格語言模型,包含手寫反向傳播、BPE 分詞器、FlashAttention 和訓練管道。

NanoEuler logo

NanoEuler

前往網站

什麼是 NanoEuler?

NanoEuler 是一個教育專案,完全使用 C 和 CUDA 實現解碼器僅變壓器(GPT-2 風格),不依賴任何機器學習函式庫。它包含位元組級別 BPE 分詞器、在書籍和網路資料上的預訓練,以及用於對話的監督微調。

NanoEuler 與相似工具比較

計價模式免費免費免費免費
免費額度
主要功能
  • 在 C/CUDA 中手寫的前向和反向傳遞
  • 具有 GPT-2 風格預分詞的位元組級別 BPE 分詞器
  • 用於 GPU 訓練的 FlashAttention 核心
  • 原生載入 DeepSeek V4、Qwen3.6 和 GLM 5.2 模型
  • 針對記憶體受限系統的自適應 Metal 駐留與 SSD 串流
  • 具備工具呼叫與編碼代理的 HTTP 伺服器
  • 使用 Project Panama FFM API 的零分配推理
  • LLM、ASR、TTS 和多模態模型的統一運行時
  • 進程全局後端以消除 VRAM 碎片
  • 純 C 實作,零外部依賴
  • 從磁碟串流專家權重,具備 LRU 快取與可選的固定熱儲存
  • 忠於 GLM-5.2 (glm_moe_dsa) 的前向傳遞,經驗證 token 完全一致
優點
  • 完全從頭實作,無依賴
  • 透過數值檢查驗證梯度準確性
  • 完全本地運行,確保資料隱私
  • 針對 Apple Silicon 最佳化,搭配 Metal 加速
  • 零分配設計,在 Java 中實現高效能
  • 跨多種模型類型(文字、視覺、音訊)的統一 API
  • 在僅 25 GB RAM 的消費級硬體上運行 744B 參數模型
  • 開源且完全透明(C 程式碼,無依賴)
缺點
  • 僅約 1.16 億參數,不適合生產環境
  • 大型模型訓練需要支援 CUDA 的 GPU
  • 主要為 Apple Silicon 設計;CUDA/ROCm 後端為次要
  • 非通用 GGUF 執行器,僅支援特定模型
  • 需要 Java 22+ 和 Project Panama(尚未在所有 JVM 中標準化)
  • 由於原生編譯,初學者的建置過程可能較複雜
  • 冷解碼速度極慢(一般 NVMe 上約 0.05-0.1 tok/s)
  • 轉換後的 int4 模型需要約 370 GB 磁碟空間
適合對象
  • 學習 LLM 訓練的開發者和研究人員
  • 研究變壓器內部機制的學生
  • 希望進行裝置端 LLM 推論的 Apple Silicon Mac 使用者
  • 尋求專門高效能推論引擎的開發者
  • 構建低記憶體開銷 AI 應用程式的 Java 開發人員
  • 需要本地端、高吞吐量推理的 LLM 和多模態模型專案
  • 希望在本機運行大型模型的開發者
  • 在有限硬體上探索 MoE 架構的 AI 研究人員

如何使用 NanoEuler?

  1. 1從 GitHub 複製儲存庫。
  2. 2確保已安裝 gcc 和 nvcc。
  3. 3執行 'make' 來建構 CPU 訓練二進位檔。
  4. 4執行 'make check' 以驗證反向傳遞。
  5. 5訓練小型模型:'./nanoeuler train'。
  6. 6訓練 GPU 模型:'./nanoeuler_cuda t'。
  7. 7微調用於對話:'./nanoeuler_cuda s'。
  8. 8與對話模型互動:'./nanoeuler_cuda c'。

NanoEuler 主要功能

  • 在 C/CUDA 中手寫的前向和反向傳遞
  • 具有 GPT-2 風格預分詞的位元組級別 BPE 分詞器
  • 用於 GPU 訓練的 FlashAttention 核心
  • 在書籍和網路語料庫上進行預訓練
  • 用於對話的監督微調(SFT)
  • 雙精度下的全模型梯度檢查
  • 檢查點/恢復訓練
  • 支援 CPU 和 GPU(CUDA)執行

NanoEuler 使用情境

  • 探索 LLM 內部機制的教育用途
  • 從頭學習變壓器訓練
  • 實驗小規模語言模型
  • 研究自訂模型架構

NanoEuler 價格與免費點數

NanoEuler 目前採用 免費 模式。

此工具完全免費使用

免費

$0

MIT 開源授權,無需註冊。

NanoEuler 優缺點

優點

  • 完全從頭實作,無依賴
  • 透過數值檢查驗證梯度準確性
  • 支援 CPU 和 GPU 訓練
  • 包含預訓練和微調管道
  • 文件完善且具教育性

缺點

  • 僅約 1.16 億參數,不適合生產環境
  • 大型模型訓練需要支援 CUDA 的 GPU
  • 因規模小,世界知識有限
  • 未提供官方預訓練檢查點

NanoEuler 最適合哪些用途?

  • 學習 LLM 訓練的開發者和研究人員
  • 研究變壓器內部機制的學生
  • 建立自訂小型模型的愛好者

NanoEuler 常見問題

NanoEuler 的免費替代工具

Opper AI logo

統一的AI閘道,透過一個符合GDPR的歐盟託管API,提供對300多種領先模型的存取,並相容於OpenAI SDK。

免費
discode.ai logo

一個聊天介面,讓您存取超過100個AI模型,自動為您的任務選擇最佳模型,同時追蹤能源使用並保護您的隱私。

免費
Oxlo.ai logo

Oxlo.ai 是一個隱私優先的 AI 推論 API,為超過 45 個開源模型提供按請求計價的方案。

免費
Graphsignal logo

Graphsignal 是一個生產規模的推論剖析平台,協助工程師在各種模型、引擎、GPU 及其他加速器上優化 AI 效能。

免費

NanoEuler 的最佳替代 AI 工具

DwarfStar logo

專為大型語言模型設計的本地推論引擎,針對 Apple Silicon 及記憶體受限系統上的 SSD 串流進行最佳化。

LibArgus logo

統一的零分配原生 AI 推理運行時,適用於 Java,通過 Project Panama 整合 LLM、視覺和語音管道。

colibri logo

一個無依賴的 C 引擎,從磁碟串流專家權重,可在消費級硬體上以僅 25 GB RAM 運行 744B 參數的 GLM-5.2 MoE 模型。

Opper AI logo

統一的AI閘道,透過一個符合GDPR的歐盟託管API,提供對300多種領先模型的存取,並相容於OpenAI SDK。

免費
Auriko logo

一個統一的 API 平台,用於 LLM 推理,具備成本最佳化、路由、可觀測性和自動故障轉移功能。

L

一款基於瀏覽器的工具,運用雅可比透鏡即時讀取語言模型的內部概念。

Frugon logo

Frugon 是一個免費、開源的 LLM 成本分析工具,透過本地分析通話記錄,找出你的 LLM 帳單漏洞。