Grands Modèles Linguistiques IA
AXIOM
AXIOM est un noyau Rust amorçable qui optimise l'inférence des transformateurs en remplaçant les abstractions génériques du système d'exploitation par des primitives spécifiques à l'inférence.
AXIOM
Qu’est-ce que AXIOM?
AXIOM est un noyau de système d'exploitation de recherche conçu spécifiquement pour exécuter efficacement des charges de travail d'inférence de transformateurs sur du matériel à mémoire limitée, en utilisant l'allocation native de tenseurs, l'ordonnancement par limites de couches et le streaming de poids à double tampon.
AXIOM vs Outils Similaires
| Modèle de Tarification | Gratuit | Gratuit | Gratuit | Gratuit |
| Crédits Gratuits | ||||
| Fonctionnalités clés |
|
|
|
|
| Avantages |
|
|
|
|
| Limites |
|
|
|
|
| Idéal pour |
|
|
|
|
Comment utiliser AXIOM?
- 1Configurez la chaîne d'outils Rust nightly et installez bootimage.
- 2Emballez les poids du modèle à l'aide du script Python fourni (pack_weights.py).
- 3Compilez le noyau avec cargo +nightly run --release.
- 4Démarrez le noyau dans QEMU ou sur du métal nu ; il effectuera l'inférence et sortira la télémétrie.
AXIOM Fonctionnalités clés
- Allocation mémoire native de tenseurs avec pools pré-réservés
- Ordonnancement par limites de couches pour éviter la préemption en milieu de couche
- Streaming de poids à double tampon pour chevaucher les E/S et le calcul
- Ordonnanceur LayerLock pour une exécution résidente en cache
- Inférence quantifiée (Q4) pour SmolLM2-135M et TinyLlama-1.1B
AXIOM Cas d’usage
- Exécution de grands modèles de langage sur des systèmes à mémoire limitée
- Optimisation de la latence d'inférence pour les modèles de transformateurs
- Recherche en optimisations au niveau du système d'exploitation pour les charges de travail IA
- Évaluation de l'impact de l'ordonnancement au niveau du noyau sur le débit d'inférence
AXIOM Tarifs et crédits gratuits
AXIOM fonctionne avec le modèle Gratuit.
AXIOM Avantages et limites
Avantages
- Réduit la surcharge de streaming de secondes à microsecondes par couche
- Optimise la disposition de la mémoire pour des motifs d'accès d'inférence prévisibles
- Open source et extensible pour la recherche
- Démontre des améliorations significatives de débit (14.8x TPS dans le benchmark)
Limites
- Actuellement limité à des modèles spécifiques (SmolLM2-135M, TinyLlama-1.1B Q4)
- Nécessite du NVMe sur métal nu pour l'évaluation prévue de la classe 7B à faible mémoire
- Les noyaux de calcul (projection FFN) restent un goulot d'étranglement
- Pas un système d'exploitation polyvalent ; manque d'espace utilisateur, de réseau, de système de fichiers
À quoi AXIOM convient-il le mieux ?
- Chercheurs en systèmes d'IA et systèmes d'exploitation
- Développeurs optimisant l'inférence sur du matériel contraint
- Ingénieurs intéressés par l'ingénierie des performances au niveau du noyau pour l'IA