M1 맥북 프로 16GB로 Gemma 4 12B 로컬 LLM 돌리기 (Ollama 설치 및 후기)

맥북 프로에 ollama 설치하기 / gemma4:12b 모델 다운로드 하기

AI시대에서 맥북에 애플 실리콘이 장착 되면서 가장 큰 장점은 cpu 램과 그래픽 램이 통합되어 있다는 것입니다. 왜냐하면 언어 모델을 돌리는 것은 그래픽 램을 많이 차지하며, 램이 클수록 더 큰 모델을 돌릴 수 있기 때문입니다. 인텔 cpu에서 16gb용량의 그래픽 카드를 확보하려면 꽤 많은 비용을 지출해야 하는데 애플 실리콘에서는 추가 비용 없이 장착된 램으로 간단한 로컬 언어 모델을 돌려 볼 수 있습니다. 로컬 모델을 테스트 해 보고자 제가 갖고 있는 맥북 프로 M1 16gb 모델에서 gemma4:12b 모델 (120억 파라미터)을 다운받아 실행해 보았습니다.

ollama를 공식 사이트에서 설치하고 터미널에 ollama run gemma4:12b 입력하면 모델을 자동으로 다운받아 줍니다. 모델용량은 약 7.4 gb이기 때문에 실제 모델을 돌리기 위해 9-10gb의 램을 사용하게 됩니다.

Hello, world! 간단한 대화 및 추론 속도 테스트

먼저 간단히 “안녕”이라고 보내 봤습니다. thinking 모드가 돌며 약 30초간 생각 후 답변을 주었습니다. gemma4:12b는 사고 모델이어서 답변을 내놓기 전 추론 과정을 거치고 있습니다. 더 최신 버전의 애플 실리콘이라면 더 빠른 답변을 기대하실 수 있겠습니다.

언제 정보까지 학습 되었나? 지식 컷오프 테스트

학습 되어 있는 가장 최신 정보는 25년 1월 정보라고 하네요. 어떤 이슈들이 있었냐 물었을 때 1월20일 미국 대통령 취임일을 정확히 말해주었습니다.

로컬 멀티모달 테스트: 이미지 인식해보기

gemma4:12b모델은 멀티모달 모델로 이미지 분석이 가능해서 이미지 분석도 테스트 해봤습니다. 학교 근처에서 하늘을 찍은 사진인데 약 1분 간의 분석 후 사진에 있는 요소들을 정확히 묘사하고 있었습니다. 보이는 것을 그대로 묘사하는 것 뿐만 아니라 이미지에 있는 정보로 여기가 도시인지 날씨는 화창한지 등을 추론하고 있습니다.

향후 계획: 블로그 초안 작성 시키기

사이드 프로젝트로 로컬 llm을 이용해 블로그 초안을 작성시키는 프로그램을 제작하고 있습니다. 이 프로그램에서 gemma4:12b 모델로 글쓰기를 시켜볼 예정입니다. 테스트가 완료되면 추후 포스팅으로 공유해 보습니다.

총평

먼저 16gb 맥북에서 로컬 언어 모델을 돌리는 것은 가능했습니다. 모델을 돌리면 램을 많이 잡아먹어서 다른 작업이 불가능 할 줄 알았는데, 다른 작업을 동시에 수행할 때 생각보다 크게 불편하지는 않았습니다. 16gb 램 내에서 돌릴수 있는 최대 파라미터에 가까운 12b 모델을 올리고 간단한 테스트 결과 간단한 대화 및 이미지 분석 수행 능력은 준수해 보였습니다. (이론상 27b 모델도 16gb 램 이내에 올릴 수 있긴 한데, 램이 거의 꽉 차서 다른 작업은 절대 불가) 원활한 작업을 감안하면 16gb 맥북에서 12b 모델을 사용하는 것이 성능과 효율 사이에서 최고의 선택지로 보입니다.

답글 남기기

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다