- 실행모델추론엔진가중치저장모델AppleSiliconGGUFHuggingFacellama.cpp LLMLMStudioMLXNVIDIAOllamaONNXOpenVINOSafetensorsTensorRT
AI 모델 포맷 정리: Safetensors, GGUF, ONNX, MLX, TensorRT 차이와 추론 엔진
Hugging Face, Ollama, LM Studio에서 사용하는 AI 모델 포맷과 추론 엔진을 정리하고 Safetensors, GGUF, ONNX, TensorRT, MLX, CoreML의 차이와 저장 포맷·실행 포맷·프레임워크·추론 엔진 개념을 함께 설명한다.
주요 모델 공유 플랫폼 및 AI 모델 파일 포맷
AI 모델을 다운로드할 수 있는 주요 플랫폼들과 각 사이트에서 주로 취급하는 모델 포맷은 다음과 같다.
| 사이트명 | 주요 특징 | 제공되는 주요 모델 형식 |
|---|---|---|
| Hugging Face (허깅페이스) | 전 세계 AI 모델의 최대 공유 플랫폼 | Safetensors(가중치 저장), PyTorch .bin, GGUF(실행 포맷), ONNX(IR 실행 포맷), MLX용 변환 모델 |
| Civitai (시비타이) | Stable Diffusion 기반 이미지 생성 모델 특화 | Safetensors, Checkpoint .ckpt, LoRA, Diffusers |
| ModelScope (모델스코프) | 중국계 AI 모델(Qwen, DeepSeek 등) 중심 플랫폼 | Safetensors, PyTorch .bin, GGUF, ModelScope SDK |
| Kaggle (캐글) | 데이터 과학·ML 실험 및 경진대회 중심 | Keras .h5/.keras, TensorFlow SavedModel, PyTorch 모델 |
| TensorFlow Hub | TensorFlow 기반 모델 배포 플랫폼 | SavedModel, TensorFlow Lite .tflite, TensorFlow.js |
| Ollama Library | 로컬 LLM 실행용 모델 저장소 | GGUF 기반 Ollama 모델 패키지 |
| LM Studio Community | 로컬 AI 실행 모델 공유 | GGUF 모델 |
AI 모델 포맷
AI 모델 포맷 종류
AI 모델 생태계에서는 저장 포맷, 실행 포맷, 추론 엔진, 프레임워크처럼 서로 다른 계층의 기술이 함께 언급되는 경우가 많다.
저장 포맷은 모델의 가중치, 텐서, 메타데이터를 저장하는 파일 형식으로 실행 기능이나 GPU 최적화, 추론 정보는 없다. 단순히 모델 데이터를 디스크에 저장하는 형식이다.
실행 포맷은 실행에 필요한 최적화 정보까지 포함한 것으로 양자화 정보, 런타임 메타정보, 특정 하드웨어 최적화 정보를 가지는 구조이며 추론 엔진이 실행할 때 필요하다.
Safetensors는 Python pickle 기반 포맷보다 안전하며, 임의 코드 실행 위험을 줄인 포맷이다. 또한 zero-copy mmap 지원 덕분에 로딩 효율이 높다.
GGUF는 llama.cpp 생태계에서 사용하는 로컬 LLM 실행 포맷으로, CPU·Apple Silicon·CUDA 환경에서 폭넓게 사용된다. 파일 하나에 메타데이터와 가중치가 함께 포함되어 관리가 쉽고, LM Studio와 Ollama 등이 이 포맷을 기반으로 작동한다.
ONNX는 하드웨어 독립적인 중간 표현(IR) 실행 포맷으로, ONNX Runtime·TensorRT·OpenVINO 등의 런타임을 통해 다양한 환경에서 실행 가능하다.
MLX 자체는 파일 포맷이 아니라 Apple Silicon용 ML 프레임워크 및 런타임이다. 실무에서 'MLX 모델'이라고 부르는 경우는 MLX 런타임에서 효율적으로 동작하도록 변환된 safetensors 기반 가중치와 관련 설정을 의미하는 경우가 많다.
| 종류 | 이름 | 주도 단체 / 개발자 | 출시 시기 | 역할 |
|---|---|---|---|---|
| 가중치 저장 포맷 | Safetensors | Hugging Face | 2022 | 범용 가중치 저장 |
| 가중치 저장 포맷 | PyTorch(.bin) | PyTorch / Meta | 2016 | PyTorch 저장 |
| 범용 실행 포맷(IR) | ONNX | Microsoft / Linux Foundation | 2017 | 범용 실행 그래프 |
| 실행 포맷 | GGUF | Georgi Gerganov (llama.cpp) | 2023 | llama.cpp 실행 최적화 |
| 실행 포맷 | TensorRT Engine | NVIDIA | 2016 | NVIDIA 실행 최적화 |
| 실행 포맷 | OpenVINO IR | Intel | 2018 | Intel 실행 최적화 |
| 실행 포맷 | CoreML | Apple | 2017 | Apple 앱 배포 및 온디바이스 실행 |
| 실행 생태계 / ML 프레임워크 | MLX | Apple | 2023 | Apple Silicon용 ML 프레임워크 |
| 양자화 실행 포맷 | EXL2 | Turboderp | 2023 | NVIDIA VRAM 최적화 |
| 양자화 실행 포맷 | GPTQ | IST-DASLab | 2022 | 범용 GPU 양자화 |
| 양자화 실행 포맷 | AWQ | MIT Han Lab | 2023 | Activation-aware 양자화 |
추론 엔진과 프레임워크
추론 엔진은 실제로 모델 계산을 수행하는 런타임 소프트웨어로 KV Cache 관리, GPU 메모리 관리, Continuous Batching, Tensor 병렬화 등의 기능을 제공하며 실제 추론을 수행한다.
특히 최근 LLM 추론 엔진은 다음 기능들이 핵심이다.
- KV Cache 최적화
- Continuous / Dynamic Batching
- PagedAttention 기반 메모리 관리
- Tensor Parallelism / Pipeline Parallelism
- Speculative Decoding
- 양자화(Quantization) 모델 실행
프레임워크는 머신러닝 개발 전체 구조를 제공한다.
Ollama, LM Studio, Open WebUI 같은 도구는 추론 엔진 상위에서 사용자 편의 기능을 제공한다.
| 종류 | 이름 | 주도 단체 / 개발자 | 출시 시기 | 역할 |
|---|---|---|---|---|
| 추론 엔진 | llama.cpp | Georgi Gerganov | 2023 | GGUF 실행 |
| 추론 엔진 | vLLM | UC Berkeley / vLLM Project | 2023 | 고성능 LLM 서빙, PagedAttention |
| 추론 엔진 | SGLang | SGLang Team | 2024 | 구조화 추론 + 고성능 서빙 |
| 추론 엔진 | TensorRT-LLM | NVIDIA | 2023 | TensorRT 기반 고성능 추론 |
| 추론 엔진 | ONNX Runtime | Microsoft | 2018 | ONNX 실행 |
| 추론 엔진 | ExLlamaV2 | Turboderp | 2023 | EXL2 실행 |
| 추론 엔진 | TGI (Text Generation Inference) | Hugging Face | 2023 | 대규모 모델 서빙 |
| 추론 엔진 | DeepSpeed-Inference | Microsoft | 2021 | 대규모 분산 추론 |
| 추론 런타임 | MLX Runtime | Apple | 2023 | Apple Silicon ML 실행 |
| ML 프레임워크 | PyTorch | Meta(Facebook) | 2016 | 범용 딥러닝 |
| ML 프레임워크 | TensorFlow | 2015 | 범용 딥러닝 | |
| ML 프레임워크 + 런타임 | JAX | 2018 | XLA 기반 고성능 연구/학습 | |
| ML 프레임워크 + 런타임 | MLX | Apple | 2023 | Apple ML 생태계 |
| GUI 기반 로컬 실행 앱 | LM Studio | Element Labs | 2023 | GUI + 로컬 모델 실행 + OpenAI 호환 API |
| 웹 UI / 관리 도구 | Open WebUI | Open WebUI Team | 2023 | 여러 추론 서버(Ollama/vLLM/OpenAI API 등)용 웹 UI |
| 모델 실행 서버 | Ollama | Ollama, Inc. | 2023 | 로컬 모델 실행 서버 + 모델 관리 + OpenAI 호환 API |
| 모델 실행 서버 | LocalAI | Ettore Di Giacinto 외 | 2023 | OpenAI 호환 로컬 추론 서버 |
| 모델 실행 플랫폼 | Xinference | Xorbits | 2023 | 멀티모델 분산 추론 및 관리 플랫폼 |
추가로:
vLLM은 현재 가장 널리 사용되는 오픈소스 LLM 서빙 엔진 중 하나이며 OpenAI 호환 API 서버 기능까지 제공한다.TensorRT-LLM,vLLM,SGLang,TGI는 주로 서버 GPU 환경에서 사용된다.llama.cpp,MLX Runtime,ExLlamaV2는 개인 PC·Mac·로컬 환경에서 많이 사용된다.Ollama,LM Studio는 내부적으로llama.cpp계열 엔진을 활용한다.SGLang은 Agent/Structured Generation/Reasoning 워크로드 최적화로 주목받고 있다.
PC 및 Mac 환경 하드웨어별 특징 요약
- NVIDIA(RTX 시리즈): TensorRT 기반 최적화와 EXL2/AWQ/GPTQ 같은 양자화 포맷을 통해 높은 추론 성능 제공
- Apple Silicon(M 시리즈): 통합 메모리 구조 덕분에 대형 모델 운용에 유리하며 설정이 간결
- Intel Panther Lake: OpenVINO 기반으로 NPU 활용 및 저전력 AI 추론에 강점
Hugging Face AI 모델
모델 이름 규칙
공식 규칙은 없지만, 일반적으로 다음 형태를 따른다.
[조직/제작자]/[모델명]-[파라미터수]-[학습단계]-[양자화/포맷]
기본 구조
예: meta-llama/Meta-Llama-3-8B-Instruct
- meta-llama: 모델 배포 조직 또는 사용자 이름
- Meta-Llama-3: 모델 시리즈 이름과 버전
- 8B: 파라미터 규모(B = Billion)
- Instruct: 모델 학습 단계
주요 접미사
- it / Instruct: Instruction 튜닝 모델
- Preview / Alpha / Beta: 테스트 버전
- GGUF:
llama.cpp기반 로컬 추론 포맷 - EXL2 / AWQ / GPTQ: NVIDIA GPU 추론용 양자화 모델
- MLX: Apple MLX 환경용 변환 모델
- fp16 / bf16: 가중치 정밀도
NVIDIA 최적화 모델 찾는 법
GGUF,EXL2,AWQ키워드를 검색- organization 필터에서 NVIDIA 관련 모델 선택
Mac(Apple Silicon) 환경용 모델 찾는 법
- MLX 패키지 사용 시: Hugging Face의
MLX-Community모델 사용 가능 - 직접 변환 시: 원본 Safetensors 모델을 받은 후
mlx_lm.convert로 변환 - LM Studio/Ollama 사용 시: GGUF 모델 다운로드 후 사용