Loading...
태그
    실행모델추론엔진가중치저장모델AppleSiliconGGUFHuggingFacellama.cpp LLMLMStudioMLXNVIDIAOllamaONNXOpenVINOSafetensorsTensorRT

AI 모델 포맷 정리: Safetensors, GGUF, ONNX, MLX, TensorRT 차이와 추론 엔진

최종수정일
2026년 09월 12일
5분걸림
작성자: Techy J
Table of Content (목차)

Hugging Face, Ollama, LM Studio에서 사용하는 AI 모델 포맷과 추론 엔진을 정리하고 Safetensors, GGUF, ONNX, TensorRT, MLX, CoreML의 차이와 저장 포맷·실행 포맷·프레임워크·추론 엔진 개념을 함께 설명한다.

주요 모델 공유 플랫폼 및 AI 모델 파일 포맷

AI 모델을 다운로드할 수 있는 주요 플랫폼들과 각 사이트에서 주로 취급하는 모델 포맷은 다음과 같다.

사이트명주요 특징제공되는 주요 모델 형식
Hugging Face (허깅페이스)전 세계 AI 모델의 최대 공유 플랫폼Safetensors(가중치 저장), PyTorch .bin, GGUF(실행 포맷), ONNX(IR 실행 포맷), MLX용 변환 모델
Civitai (시비타이)Stable Diffusion 기반 이미지 생성 모델 특화Safetensors, Checkpoint .ckpt, LoRA, Diffusers
ModelScope (모델스코프)중국계 AI 모델(Qwen, DeepSeek 등) 중심 플랫폼Safetensors, PyTorch .bin, GGUF, ModelScope SDK
Kaggle (캐글)데이터 과학·ML 실험 및 경진대회 중심Keras .h5/.keras, TensorFlow SavedModel, PyTorch 모델
TensorFlow HubTensorFlow 기반 모델 배포 플랫폼SavedModel, TensorFlow Lite .tflite, TensorFlow.js
Ollama Library로컬 LLM 실행용 모델 저장소GGUF 기반 Ollama 모델 패키지
LM Studio Community로컬 AI 실행 모델 공유GGUF 모델

AI 모델 포맷

AI 모델 포맷 종류

AI 모델 생태계에서는 저장 포맷, 실행 포맷, 추론 엔진, 프레임워크처럼 서로 다른 계층의 기술이 함께 언급되는 경우가 많다.

저장 포맷은 모델의 가중치, 텐서, 메타데이터를 저장하는 파일 형식으로 실행 기능이나 GPU 최적화, 추론 정보는 없다. 단순히 모델 데이터를 디스크에 저장하는 형식이다.

실행 포맷은 실행에 필요한 최적화 정보까지 포함한 것으로 양자화 정보, 런타임 메타정보, 특정 하드웨어 최적화 정보를 가지는 구조이며 추론 엔진이 실행할 때 필요하다.

Safetensors는 Python pickle 기반 포맷보다 안전하며, 임의 코드 실행 위험을 줄인 포맷이다. 또한 zero-copy mmap 지원 덕분에 로딩 효율이 높다.

GGUF는 llama.cpp 생태계에서 사용하는 로컬 LLM 실행 포맷으로, CPU·Apple Silicon·CUDA 환경에서 폭넓게 사용된다. 파일 하나에 메타데이터와 가중치가 함께 포함되어 관리가 쉽고, LM Studio와 Ollama 등이 이 포맷을 기반으로 작동한다.

ONNX는 하드웨어 독립적인 중간 표현(IR) 실행 포맷으로, ONNX Runtime·TensorRT·OpenVINO 등의 런타임을 통해 다양한 환경에서 실행 가능하다.

MLX 자체는 파일 포맷이 아니라 Apple Silicon용 ML 프레임워크 및 런타임이다. 실무에서 'MLX 모델'이라고 부르는 경우는 MLX 런타임에서 효율적으로 동작하도록 변환된 safetensors 기반 가중치와 관련 설정을 의미하는 경우가 많다.

종류이름주도 단체 / 개발자출시 시기역할
가중치 저장 포맷SafetensorsHugging Face2022범용 가중치 저장
가중치 저장 포맷PyTorch(.bin)PyTorch / Meta2016PyTorch 저장
범용 실행 포맷(IR)ONNXMicrosoft / Linux Foundation2017범용 실행 그래프
실행 포맷GGUFGeorgi Gerganov (llama.cpp)2023llama.cpp 실행 최적화
실행 포맷TensorRT EngineNVIDIA2016NVIDIA 실행 최적화
실행 포맷OpenVINO IRIntel2018Intel 실행 최적화
실행 포맷CoreMLApple2017Apple 앱 배포 및 온디바이스 실행
실행 생태계 / ML 프레임워크MLXApple2023Apple Silicon용 ML 프레임워크
양자화 실행 포맷EXL2Turboderp2023NVIDIA VRAM 최적화
양자화 실행 포맷GPTQIST-DASLab2022범용 GPU 양자화
양자화 실행 포맷AWQMIT Han Lab2023Activation-aware 양자화

추론 엔진과 프레임워크

추론 엔진은 실제로 모델 계산을 수행하는 런타임 소프트웨어로 KV Cache 관리, GPU 메모리 관리, Continuous Batching, Tensor 병렬화 등의 기능을 제공하며 실제 추론을 수행한다.

특히 최근 LLM 추론 엔진은 다음 기능들이 핵심이다.

  • KV Cache 최적화
  • Continuous / Dynamic Batching
  • PagedAttention 기반 메모리 관리
  • Tensor Parallelism / Pipeline Parallelism
  • Speculative Decoding
  • 양자화(Quantization) 모델 실행

프레임워크는 머신러닝 개발 전체 구조를 제공한다.

Ollama, LM Studio, Open WebUI 같은 도구는 추론 엔진 상위에서 사용자 편의 기능을 제공한다.

종류이름주도 단체 / 개발자출시 시기역할
추론 엔진llama.cppGeorgi Gerganov2023GGUF 실행
추론 엔진vLLMUC Berkeley / vLLM Project2023고성능 LLM 서빙, PagedAttention
추론 엔진SGLangSGLang Team2024구조화 추론 + 고성능 서빙
추론 엔진TensorRT-LLMNVIDIA2023TensorRT 기반 고성능 추론
추론 엔진ONNX RuntimeMicrosoft2018ONNX 실행
추론 엔진ExLlamaV2Turboderp2023EXL2 실행
추론 엔진TGI (Text Generation Inference)Hugging Face2023대규모 모델 서빙
추론 엔진DeepSpeed-InferenceMicrosoft2021대규모 분산 추론
추론 런타임MLX RuntimeApple2023Apple Silicon ML 실행
ML 프레임워크PyTorchMeta(Facebook)2016범용 딥러닝
ML 프레임워크TensorFlowGoogle2015범용 딥러닝
ML 프레임워크 + 런타임JAXGoogle2018XLA 기반 고성능 연구/학습
ML 프레임워크 + 런타임MLXApple2023Apple ML 생태계
GUI 기반 로컬 실행 앱LM StudioElement Labs2023GUI + 로컬 모델 실행 + OpenAI 호환 API
웹 UI / 관리 도구Open WebUIOpen WebUI Team2023여러 추론 서버(Ollama/vLLM/OpenAI API 등)용 웹 UI
모델 실행 서버OllamaOllama, Inc.2023로컬 모델 실행 서버 + 모델 관리 + OpenAI 호환 API
모델 실행 서버LocalAIEttore Di Giacinto 외2023OpenAI 호환 로컬 추론 서버
모델 실행 플랫폼XinferenceXorbits2023멀티모델 분산 추론 및 관리 플랫폼

추가로:

  • vLLM은 현재 가장 널리 사용되는 오픈소스 LLM 서빙 엔진 중 하나이며 OpenAI 호환 API 서버 기능까지 제공한다.
  • TensorRT-LLM, vLLM, SGLang, TGI는 주로 서버 GPU 환경에서 사용된다.
  • llama.cpp, MLX Runtime, ExLlamaV2는 개인 PC·Mac·로컬 환경에서 많이 사용된다.
  • Ollama, LM Studio는 내부적으로 llama.cpp 계열 엔진을 활용한다.
  • SGLang은 Agent/Structured Generation/Reasoning 워크로드 최적화로 주목받고 있다.

PC 및 Mac 환경 하드웨어별 특징 요약

  • NVIDIA(RTX 시리즈): TensorRT 기반 최적화와 EXL2/AWQ/GPTQ 같은 양자화 포맷을 통해 높은 추론 성능 제공
  • Apple Silicon(M 시리즈): 통합 메모리 구조 덕분에 대형 모델 운용에 유리하며 설정이 간결
  • Intel Panther Lake: OpenVINO 기반으로 NPU 활용 및 저전력 AI 추론에 강점

Hugging Face AI 모델

모델 이름 규칙

공식 규칙은 없지만, 일반적으로 다음 형태를 따른다.

[조직/제작자]/[모델명]-[파라미터수]-[학습단계]-[양자화/포맷]

기본 구조

예: meta-llama/Meta-Llama-3-8B-Instruct

  • meta-llama: 모델 배포 조직 또는 사용자 이름
  • Meta-Llama-3: 모델 시리즈 이름과 버전
  • 8B: 파라미터 규모(B = Billion)
  • Instruct: 모델 학습 단계

주요 접미사

  • it / Instruct: Instruction 튜닝 모델
  • Preview / Alpha / Beta: 테스트 버전
  • GGUF: llama.cpp 기반 로컬 추론 포맷
  • EXL2 / AWQ / GPTQ: NVIDIA GPU 추론용 양자화 모델
  • MLX: Apple MLX 환경용 변환 모델
  • fp16 / bf16: 가중치 정밀도

NVIDIA 최적화 모델 찾는 법

  • GGUF, EXL2, AWQ 키워드를 검색
  • organization 필터에서 NVIDIA 관련 모델 선택

Mac(Apple Silicon) 환경용 모델 찾는 법

  • MLX 패키지 사용 시: Hugging Face의 MLX-Community 모델 사용 가능
  • 직접 변환 시: 원본 Safetensors 모델을 받은 후 mlx_lm.convert로 변환
  • LM Studio/Ollama 사용 시: GGUF 모델 다운로드 후 사용
이 글은 ' 출처: 변호사 전정숙 '과 ' 원본링크: https://www.korean-lawer.com/articles/ai-dev/ai-model-format-safetensors-gguf-onnx-mlx-tensorrt'를 명시하는 조건으로 인용가능 합니다.
무단 복제, AI 학습 목적으로의 사용과 Google, Naver의 Indexing 외 크롤링 금지합니다
About
전정숙 변호사
법무법인 정맥 파트너 변호사부산파산법원 파산관재인전) 부산변호사회 부회장전) 전국여성변호사회 부회장전) 부산 가정법원 조정위원
Contact

(82) 051-916-8582 , 051-916-8583

부산광역시 연제구 법원로 12 (거제동)

로윈타워빌딩 2층 법무법인정맥

변호사 전정숙

© 2005-2026 전정숙 변호사.

All Rights Reserved.