허깅페이스, Transformers에 GGUF 실행 지원

허깅페이스가 transformers에서 llama.cpp용 양자화 모델을 직접 실행하는 기능을 추가한다고 9월 22일 발표했다. 허브(Hub)의 GGUF 체크포인트를 from_pretrained로 불러와 기존 Transformers API로 생성 작업을 수행할 수 있다. 초기 지원 대상은 애플 실리콘과 Qwen3.5 아키텍처이며, 정식 릴리스 전까지는 Transformers의 main 버전과 호환되는 kernels가 필요하다.1

GGUF는 모델 가중치와 토크나이저 정보, 선택적 채팅 템플릿을 한 파일에 담는 형식이다. 양자화 수준에 따라 메모리 사용량과 정밀도를 조절할 수 있다. Unsloth의 Qwen3.5-4B는 BF16 파일이 8.42GB인 반면 Q6_K는 3.53GB, Q5_K_M은 3.14GB, Q4_K_M은 2.74GB다. 허깅페이스는 로컬 실행의 출발점으로 Q4_K_M을 권하면서도, 품질 손실은 모델과 작업에 따라 달라 실제 용도에서 평가해야 한다고 설명했다.

성능을 llama.cpp에 가깝게 맞추기 위해 kernels 라이브러리로 ggml 커널을 재사용하고 generate의 부가 비용도 줄였다. 가중치를 Metal에 압축된 상태로 유지하면 호환되는 ggml/Metal 계층 커널과 ggml-attn을 자동 적용한다. 커널을 가져오지 못하면 경고와 함께 sdpa로 전환된다. 현재 지원 범위가 애플 실리콘과 특정 아키텍처에서 시작한다는 점은 범용 GGUF 실행 지원과 구분할 필요가 있다.

Footnotes

  1. Hugging Face 블로그·커뮤니티, 「Transformers now runs llama.cpp quants」 ↩

반응 확인 중

읽기 목록은 이 브라우저에 저장됩니다.

출처

  1. Transformers now runs llama.cpp quants — Hugging Face 블로그·커뮤니티 · 자료: 2026. 9. 22.

이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요. 교차 보도 없이 단독 출처로 작성됐습니다.