AI 대형 언어 모델 (LLM)
AXIOM
AXIOM은 부팅 가능한 Rust 커널로, 일반적인 OS 추상화를 추론에 특화된 프리미티브로 대체하여 트랜스포머 추론을 최적화합니다.
AXIOM
AXIOM란?
AXIOM은 메모리 제약이 있는 하드웨어에서 트랜스포머 추론 워크로드를 효율적으로 실행하기 위해 설계된 연구용 운영 체제 커널입니다. 텐서 네이티브 할당, 레이어 경계 스케줄링, 이중 버퍼 가중치 스트리밍을 사용합니다.
AXIOM vs 유사 도구
| 가격 모델 | 무료 | 무료 | 무료 | 무료 |
| 무료 크레딧 | ||||
| 주요 기능 |
|
|
|
|
| 장점 |
|
|
|
|
| 단점 |
|
|
|
|
| 추천 대상 |
|
|
|
|
AXIOM 사용 방법
- 1Rust nightly 툴체인을 설정하고 bootimage를 설치합니다.
- 2제공된 Python 스크립트(pack_weights.py)를 사용하여 모델 가중치를 패킹합니다.
- 3cargo +nightly run --release로 커널을 빌드합니다.
- 4QEMU 또는 베어 메탈에서 커널을 부팅하면 추론을 수행하고 텔레메트리를 출력합니다.
AXIOM 주요 기능
- 사전 예약 풀을 사용한 텐서 네이티브 메모리 할당
- 중간 레이어 선점을 방지하는 레이어 경계 스케줄링
- I/O와 연산을 중첩하는 이중 버퍼 가중치 스트리밍
- 캐시 상주 실행을 위한 LayerLock 스케줄러
- SmolLM2-135M 및 TinyLlama-1.1B를 위한 양자화된 추론(Q4)
AXIOM 사용 사례
- 메모리 제약 시스템에서 대규모 언어 모델 실행
- 트랜스포머 모델의 추론 지연 시간 최적화
- AI 워크로드를 위한 OS 수준 최적화 연구
- 커널 수준 스케줄링이 추론 처리량에 미치는 영향 평가
AXIOM 가격 및 무료 크레딧
AXIOM의 가격 모델은 무료입니다.
AXIOM 장점과 단점
장점
- 레이어당 스트리밍 오버헤드를 초에서 마이크로초로 줄입니다.
- 예측 가능한 추론 액세스 패턴을 위해 메모리 레이아웃을 최적화합니다.
- 오픈 소스이며 연구를 위해 확장 가능합니다.
- 벤치마크에서 14.8배의 TPS 향상을 보여줍니다.
단점
- 현재 특정 모델(SmolLM2-135M, TinyLlama-1.1B Q4)로 제한됩니다.
- 의도된 저메모리 7B급 평가를 위해 베어 메탈 NVMe가 필요합니다.
- 컴퓨트 커널(FFN 투영)이 여전히 병목입니다.
- 범용 OS가 아닙니다. 사용자 공간, 네트워킹, 파일 시스템이 없습니다.
AXIOM은 어떤 용도에 가장 적합한가요?
- AI 시스템 및 운영 체제 연구자
- 제약된 하드웨어에서 추론을 최적화하는 개발자
- AI를 위한 커널 수준 성능 엔지니어링에 관심 있는 엔지니어