Running Kimi K3 on a M1 Max
델타핀(Deltafin) 프로젝트는 2.8조 파라미터를 가진 Mixture-of-Experts(MoE) 모델인 Kimi K3를 단일 Apple Silicon Mac에서 구동하는 연구를 수행했습니다. 이 시스템은 모델 크기보다 훨씬 큰 모델을 로컬 환경에서 실행하며, MXFP4 전문가들을 HTTP를 통해 요청 시점에 로컬 디스크 캐시에 스트리밍하는 방식을 사용합니다.
이 구현은 Metal/MPS 컴퓨팅과 NEON 커널을 결합한 융합된 커널을 사용하여 정확하고 재현 가능한 디코딩을 가능하게 합니다. 추론 과정에서 토큰당 16개의 전문가와 92개 레이어에 해당하는 25.8GB의 전문가 데이터를 로컬 디스크에서 읽어오며, 이는 네트워크를 통한 스트리밍보다 훨씬 빠른 속도로 데이터를 처리합니다.
이 방식은 로컬 환경에서 대규모 모델을 구동하는 데 필요한 I/O 병목 현상을 해결하며, OpenAI 호환 API 서버를 제공하여 로컬 채팅 및 코딩 에이전트 구동이 가능합니다. 다만, 전체 모델을 로컬에 저장할 경우 약 1.7TB의 디스크 공간이 필요하며, 추론 속도는 캐싱 후 토큰당 약 60~76초 정도 소요됩니다.
이 프로젝트는 Kimi K3의 가중치와 모델링 코드를 공개하며, flash-linear-attention과 같은 선행 연구 및 llama.cpp 등의 기술을 기반으로 하며 MIT 라이선스로 배포되어 있습니다. 이는 로컬 LLM 추론 환경에서 효율성과 재현성을 높이는 데 기여하는 오픈 소스 개발의 사례입니다.
이 구현은 Metal/MPS 컴퓨팅과 NEON 커널을 결합한 융합된 커널을 사용하여 정확하고 재현 가능한 디코딩을 가능하게 합니다. 추론 과정에서 토큰당 16개의 전문가와 92개 레이어에 해당하는 25.8GB의 전문가 데이터를 로컬 디스크에서 읽어오며, 이는 네트워크를 통한 스트리밍보다 훨씬 빠른 속도로 데이터를 처리합니다.
이 방식은 로컬 환경에서 대규모 모델을 구동하는 데 필요한 I/O 병목 현상을 해결하며, OpenAI 호환 API 서버를 제공하여 로컬 채팅 및 코딩 에이전트 구동이 가능합니다. 다만, 전체 모델을 로컬에 저장할 경우 약 1.7TB의 디스크 공간이 필요하며, 추론 속도는 캐싱 후 토큰당 약 60~76초 정도 소요됩니다.
이 프로젝트는 Kimi K3의 가중치와 모델링 코드를 공개하며, flash-linear-attention과 같은 선행 연구 및 llama.cpp 등의 기술을 기반으로 하며 MIT 라이선스로 배포되어 있습니다. 이는 로컬 LLM 추론 환경에서 효율성과 재현성을 높이는 데 기여하는 오픈 소스 개발의 사례입니다.