내 칩셋에서 얼마나 빠를지, 돌려보기 전에 알 수 있게.
폰·PC·차량용으로 양자화한 경량 모델을 칩셋별 속도, 메모리, 정확도 측정값과 함께 받을 수 있는 허브를 준비하고 있습니다. 테스트 기기마다 빌드해서 재 보는 일을 줄이려고 합니다.
출시 전 베타 대기자 모집 중
받은 파일은 기기에서 바로 실행합니다 (예시)
llama-cli -m lm-1b-int4.gguf
-p "회의록을 세 줄로 요약해 줘"경량 언어모델, 칩셋별 측정표
예시 화면측정 조건: 입력 128토큰, 출력 256토큰, 기기별 기본 런타임
| 모델 | 플래그십 폰 | 보급형 폰 | 노트북 NPU | 차량용 SoC |
|---|---|---|---|---|
| 1B INT4 | 42 | 19 | 55 | 31 |
| 1B INT8 | 29 | 11 | 40 | 22 |
| 3B INT4 | 18 | 6 | 26 | 12 |
| 3B INT8 | 11 | 메모리 부족 | 17 | 7 |
| 7B INT4 | 7 | 메모리 부족 | 12 | 메모리 부족 |
모델 하나 고르는 데 일주일이 가는 이유
공개된 벤치마크는 대부분 서버 GPU 기준이라, 우리 앱이 도는 폰에서는 참고가 안 됩니다.
같은 모델도 칩셋과 런타임에 따라 속도가 몇 배씩 차이 납니다. 결국 기기를 꺼내 직접 재야 합니다.
양자화 버전이 여러 개인데, 어느 쪽이 정확도를 덜 잃는지 알 수가 없습니다.
INT4, INT8, 혼합 정밀도마다 파일이 따로 있고, 한국어 품질이 얼마나 떨어지는지는 써 봐야 압니다.
테스트 기기마다 빌드하고 돌리다 보면 모델 하나 고르는 데 일주일이 갑니다.
보급형 폰에서 메모리가 모자라 앱이 꺼지는 것도 한참 뒤에야 알게 됩니다.
출시하면 이렇게 쓰게 됩니다
기기와 칩셋 고르기
폰, 노트북, 차량용 보드 중에서 내 제품이 돌아갈 칩셋을 고릅니다.
예시 화면:- 플래그십 폰
- 보급형 폰
- 노트북 NPU
- 차량용 SoC
측정값 비교하기
그 칩셋에서 잰 초당 토큰, 첫 응답까지 걸린 시간, 메모리 사용량, 정확도 하락폭을 모델별로 나란히 봅니다.
예시 화면:- 1B INT4
- 42토큰/초
- 180 ms
- 3B INT4
- 18토큰/초
- 410 ms
맞는 파일 받기
고른 칩셋에 맞게 양자화된 모델 파일과 측정 조건을 함께 내려받습니다.
예시 화면:- lm-1b-int4.gguf0.8 GB
- bench-conditions.json2 KB
화면 조각은 출시 후 모습을 설명하기 위한 예시입니다.
누구를 위한 곳인가요
의도된 사용
- 안드로이드·iOS 앱에 음성 인식, 요약, 번역 같은 기능을 기기 안에서 돌리려는 개발자
- NPU가 달린 노트북용 PC 앱에 로컬 모델을 넣으려는 팀
- 차량 인포테인먼트나 임베디드 보드에서 모델을 돌려야 하는 엔지니어
범위 밖 사용
- 서버나 클라우드 GPU에서 모델을 서빙하는 팀
- 모델을 직접 학습하거나 자체 양자화 파이프라인을 만들려는 팀
베타가 열리면 먼저 알려드릴게요
이메일을 남겨 주세요. 지금 모델을 어떻게 고르고 있는지도 적어 주시면 좋습니다(선택).
자주 묻는 질문
지금 바로 쓸 수 있나요?
아직 출시 전입니다. 대기자로 등록하시면 베타가 열릴 때 가장 먼저 초대 메일을 보내드립니다. 가격은 아직 정하지 않았습니다.
어떤 모델을 올릴 계획인가요?
상업적으로 쓸 수 있는 라이선스로 공개된 경량 모델을 골라, 칩셋별로 측정해 올릴 계획입니다. 처음에는 언어모델, 음성 인식, 이미지 모델부터 시작하려고 합니다.
측정값은 믿을 수 있나요?
실제 기기에서 같은 조건으로 재고, 런타임 버전과 입력 길이 같은 측정 조건을 숫자와 함께 공개할 계획입니다.