AI 大语言模型 (LLM)

NanoEuler

NanoEuler 是一个完全用 C/CUDA 编写的开源 GPT-2 风格语言模型,包括手写反向传播、BPE 分词器、FlashAttention 和训练流水线。

NanoEuler logo

NanoEuler

访问官网

什么是 NanoEuler?

NanoEuler 是一个教育项目,完全用 C 和 CUDA 实现了仅解码器 Transformer(GPT-2 风格),不依赖任何机器学习库。它包含字节级 BPE 分词器、在书籍和网络数据上的预训练,以及用于聊天的监督微调。

NanoEuler 与相似工具比较

计价模式免费免费免费免费
免费额度
主要功能
  • 用 C/CUDA 手写前向和反向传播
  • 字节级 BPE 分词器,采用 GPT-2 风格预分词
  • 用于 GPU 训练的 FlashAttention 内核
  • 原生加载DeepSeek V4、Qwen3.6和GLM 5.2模型
  • 自适应Metal驻留和SSD流式处理,适用于内存受限系统
  • 支持工具调用和编码代理的HTTP服务器
  • 使用Project Panama FFM API实现零分配推理
  • 统一的LLM、ASR、TTS和多模态模型运行时
  • 进程全局后端消除VRAM碎片
  • 纯C实现,零外部依赖
  • 从磁盘流式传输专家权重,带有LRU缓存和可选的热存储固定
  • 忠实的GLM-5.2(glm_moe_dsa)前向传播,验证为令牌精确
优点
  • 完全从零实现,无依赖
  • 通过数值检查验证梯度准确性
  • 完全本地运行,确保数据隐私
  • 针对Apple Silicon优化,支持Metal加速
  • Java中零分配设计实现高性能
  • 跨多种模型类型(文本、视觉、音频)的统一API
  • 在仅25 GB RAM的消费级硬件上运行744B参数模型
  • 开源且完全透明(C代码,无依赖)
缺点
  • 仅约1.16亿参数,不适合生产环境
  • 大型模型训练需要支持 CUDA 的 GPU
  • 主要为Apple Silicon设计;CUDA/ROCm后端为次要
  • 不是通用的GGUF运行器,仅支持特定模型
  • 需要Java 22+和Project Panama(并非所有JVM都默认支持)
  • 由于原生编译,构建过程对新手可能较复杂
  • 冷解码速度极慢(典型NVMe上0.05-0.1 tok/s)
  • 需要约370 GB磁盘空间存放转换后的int4模型
适合对象
  • 学习和研究 LLM 训练的开发者与研究人员
  • 学习 Transformer 内部原理的学生
  • 希望进行设备端LLM推理的Apple Silicon Mac用户
  • 寻求专用高性能推理引擎的开发者
  • 构建低内存开销AI应用的Java开发者
  • 需要本地化、高吞吐量LLM和多模态模型推理的项目
  • 希望本地运行大规模模型的开发者
  • 在有限硬件上探索MoE架构的AI研究人员

如何使用 NanoEuler?

  1. 1从 GitHub 克隆仓库。
  2. 2确保安装了 gcc 和 nvcc。
  3. 3运行 'make' 构建 CPU 训练二进制文件。
  4. 4运行 'make check' 验证反向传播正确性。
  5. 5训练小型模型:'./nanoeuler train'。
  6. 6训练 GPU 模型:'./nanoeuler_cuda t'。
  7. 7微调聊天模型:'./nanoeuler_cuda s'。
  8. 8与聊天模型交互:'./nanoeuler_cuda c'。

NanoEuler 主要功能

  • 用 C/CUDA 手写前向和反向传播
  • 字节级 BPE 分词器,采用 GPT-2 风格预分词
  • 用于 GPU 训练的 FlashAttention 内核
  • 在书籍和网络语料库上的预训练
  • 用于聊天的监督微调(SFT)
  • 全模型双精度梯度检查
  • 检查点/恢复训练
  • 支持 CPU 和 GPU(CUDA)执行

NanoEuler 使用场景

  • LLM 内部原理的教育探索
  • 从头学习 Transformer 训练
  • 实验小规模语言模型
  • 自定义模型架构的研究

NanoEuler 价格与免费额度

NanoEuler 目前采用 免费 模式。

此工具完全免费使用

免费

$0

开源MIT许可证,无需注册。

NanoEuler 优缺点

优点

  • 完全从零实现,无依赖
  • 通过数值检查验证梯度准确性
  • 同时支持 CPU 和 GPU 训练
  • 包含预训练和微调流水线
  • 文档完善且具有教育意义

缺点

  • 仅约1.16亿参数,不适合生产环境
  • 大型模型训练需要支持 CUDA 的 GPU
  • 由于规模小,世界知识有限
  • 未提供官方预训练检查点

NanoEuler 最适合哪些用途?

  • 学习和研究 LLM 训练的开发者与研究人员
  • 学习 Transformer 内部原理的学生
  • 构建自定义小型模型的爱好者

NanoEuler 常见问题

NanoEuler 的免费替代工具

Opper AI logo

一个统一的AI网关,通过一个欧盟托管、符合GDPR的API提供300多个领先模型的访问,并兼容OpenAI SDK的接口。

免费
discode.ai logo

一个聊天气泡界面,即可访问超过100个AI模型,自动为您的任务选择最佳模型,同时跟踪能源使用并保护您的隐私。

免费
Oxlo.ai logo

Oxlo.ai 是一个隐私优先的 AI 推理 API,为超过 45 个开源模型提供按请求计费的定价。

免费
Graphsignal logo

Graphsignal 是一个生产级推理性能分析平台,帮助工程师跨模型、引擎、GPU 及其他加速器优化 AI 性能。

免费

NanoEuler 的最佳替代 AI 工具

DwarfStar logo

一个专门用于大型语言模型的本地推理引擎,针对Apple Silicon和内存受限系统上的SSD流式处理进行了优化。

LibArgus logo

统一的零分配原生AI推理运行时,专为Java设计,通过Project Panama整合LLM、视觉和语音管道。

colibri logo

一个无依赖的C引擎,从磁盘流式传输专家权重,以在消费级硬件上运行744B参数的GLM-5.2 MoE模型,仅需25 GB RAM。

Opper AI logo

一个统一的AI网关,通过一个欧盟托管、符合GDPR的API提供300多个领先模型的访问,并兼容OpenAI SDK的接口。

免费
Auriko logo

用于LLM推理的统一API平台,具有成本优化、路由、可观测性和自动故障转移功能。

L

一款基于浏览器的工具,利用雅可比透镜实时读取语言模型的内部概念。

Frugon logo

Frugon 是一个免费、开源的 LLM 成本分析工具,通过本地分析您的调用日志,识别出您的 LLM 账单在哪里产生不必要的花费。