Duże Modele Językowe AI
NanoEuler
NanoEuler to otwartoźródłowy model językowy w stylu GPT-2, zbudowany całkowicie od podstaw w C/CUDA z ręcznie napisanym backpropem, tokenizerem BPE, FlashAttention i potokami treningowymi.
NanoEuler
Czym jest NanoEuler?
NanoEuler to projekt edukacyjny implementujący transformer typu decoder-only (w stylu GPT-2) w całości w C i CUDA, bez bibliotek uczenia maszynowego. Zawiera tokenizator BPE na poziomie bajtów, pretrenowanie na książkach i danych internetowych oraz nadzorowane dostrajanie do czatu.
NanoEuler vs Podobne Narzędzia
| Model Cen | Darmowe | Darmowe | Darmowe | Darmowe |
| Darmowe kredyty | ||||
| Najważniejsze funkcje |
|
|
|
|
| Plusy |
|
|
|
|
| Minusy |
|
|
|
|
| Najlepsze dla |
|
|
|
|
Jak używać NanoEuler?
- 1Sklonuj repozytorium z GitHub.
- 2Upewnij się, że gcc i nvcc są zainstalowane.
- 3Uruchom 'make', aby zbudować binarkę treningową CPU.
- 4Uruchom 'make check', aby zweryfikować przejście wstecz.
- 5Trenuj mały model: './nanoeuler train'.
- 6Trenuj model GPU: './nanoeuler_cuda t'.
- 7Dostrajaj do czatu: './nanoeuler_cuda s'.
- 8Interakcja z modelem czatu: './nanoeuler_cuda c'.
NanoEuler Najważniejsze funkcje
- Ręcznie napisane przejścia w przód i wstecz w C/CUDA
- Tokenizator BPE na poziomie bajtów z pretokenizacją w stylu GPT-2
- Jądro FlashAttention do trenowania na GPU
- Pretrenowanie na książkach i korpusie internetowym
- Nadzorowane dostrajanie do czatu (SFT)
- Sprawdzanie gradientów całego modelu w podwójnej precyzji
- Zapisywanie i wznawianie treningu
- Obsługa wykonywania na CPU i GPU (CUDA)
NanoEuler Zastosowania
- Edukacyjne eksplorowanie wnętrza LLM
- Nauka trenowania transformerów od podstaw
- Eksperymentowanie z małymi modelami językowymi
- Badania nad niestandardowymi architekturami modeli
NanoEuler Ceny i darmowe kredyty
NanoEuler działa w modelu Darmowe.
To narzędzie jest w pełni darmowe
NanoEuler Plusy i minusy
Plusy
- Pełna implementacja od podstaw, bez zależności
- Zweryfikowana dokładność gradientów poprzez sprawdzenie numeryczne
- Obsługuje trenowanie na CPU i GPU
- Obejmuje potoki pretrenowania i dostrajania
- Dobrze udokumentowany i edukacyjny
Minusy
- Tylko ~116 milionów parametrów, nie nadaje się do produkcji
- Wymaga GPU z obsługą CUDA do trenowania dużego modelu
- Ograniczona wiedza o świecie ze względu na mały rozmiar
- Brak oficjalnych wstępnie wytrenowanych punktów kontrolnych
Do czego najlepiej nadaje się NanoEuler?
- Programiści i naukowcy uczący się trenowania LLM
- Studenci badający wnętrze transformerów
- Hobbyści budujący niestandardowe małe modele