최근 AI 모델은 비약적으로 발전했지만, 모델의 대형화로 인해 막대한 연산량이 필요하다는 과제도 함께 안게 되었습니다. Stanford HAI의 The 2025 AI Index Report[1]에 따르면, 최근 주요 AI 모델 학습에 투입되는 연산량이 5개월마다 대략 2배씩 폭발적으로 늘어나는 추세를 보이고 있습니다.
그림 1 개발 주체별 주요 AI 모델의 학습 연산량 추이(2003~2024)[1]
문제는 이러한 막대한 연산이 비단 학습 단계에만 그치지 않는다는 점입니다. 학습을 마친 모델을 실행하는 추론 단계에서도 연산을 수행하고 중간 계산 결과를 저장·이동하는 과정에서도 많은 에너지가 필요합니다[2].
이처럼 연산과 메모리 사용, 데이터 이동에서 발생하는 자원 부담은 높은 성능의 AI 모델을 실제 사용 환경에 적용할 때 중요한 제약이 됩니다. 서버에서는 잘 작동하는 모델도 스마트폰이나 소형 기기에서는 실행 속도가 느려지거나 메모리가 부족해 정상적으로 작동하지 않을 수 있으며, 전력 소모가 커져 발열이 발생할 수 있습니다. 온디바이스 AI 환경에서 나타나는 모델 구동의 제약은 대규모 AI 모델을 실제 사용 환경에 적용할 때 발생하는 자원 문제를 보여주는 대표적인 사례입니다.
따라서 높은 성능의 AI를 만드는 것만큼, 실제 사용 환경에서 모델이 효율적으로 작동하도록 만드는 일도 중요합니다. 이처럼 AI 모델의 자원 소모를 줄이고 실행 효율을 극복하는 작업을 AI 모델 경량화라고 합니다.
AI 경량화는 학습 단계와 추론 단계로 나누어 생각할 수 있습니다. 학습 단계에서는 모델을 학습하는 데 필요한 연산량과 메모리, 시간과 전력을 줄이는 것이 중요하며, 추론 단계에서는 학습이 끝난 모델을 실제 사용 환경에서 실행할 때 필요한 모델 크기와 실행 메모리, 처리 시간과 전력 소모를 줄이는 데 초점을 둡니다.
이번 글에서는 학습된 AI 모델을 실제 기기에서 실행하기 위한 추론 단계의 경량화를 중심으로 살펴보겠습니다. 추론 경량화에는 다양한 방법이 있으며, 경우에 따라서는 모델이 경량화 과정에서 달라진 구조나 연산 방식에 적응하도록 추가 학습을 병행하기도 합니다. 이러한 추가 학습은 학습 연산량이나 학습 시간 등의 학습 비용을 줄이는 것이 아니라, 모델이 경량화된 형태에서도 성능을 최대한 유지하며 적은 자원으로 추론할 수 있도록 하는 과정입니다. 어떤 경량화 방법을 선택해 어떻게 적용할지, 추가 학습을 병행할지는 모델의 구조와 특성, 목표 기기와 실행 환경에 따라 달라질 수 있습니다.
저희 연구팀도 모델과 실행 환경의 특성을 함께 고려하여, 자체 개발한 AI 모델을 다양한 환경에서 효율적으로 활용하기 위한 경량화 방안을 연구하고 있습니다. 구체적인 연구 내용을 소개하기에 앞서, 먼저 AI 모델 경량화의 의미와 성공 기준, 대표적인 방법을 살펴보겠습니다.
AI 모델 경량화의 핵심은?
경량화의 효과를 이해하려면 먼저 모델의 자원 사용에 영향을 주는 요소를 살펴볼 필요가 있습니다. AI 모델에는 학습 과정에서 데이터에 나타난 패턴과 입력과 출력 사이의 관계를 반영하도록 조정된 수많은 숫자가 저장되어 있습니다. 이를 파라미터(parameter)라고 하며, 파라미터가 많을수록 일반적으로 모델 파일이 커지고, 모델을 저장하거나 실행하기 위해서 그에 맞는 용량의 하드웨어가 필요합니다.
모델이 입력을 처리하는 동안에는 각 단계에서 액티베이션(activation)이라는 중간 계산 결과가 만들어지는데, 모델 파일의 크기가 작더라도 액티베이션이 크면 실행 중 많은 메모리가 필요할 수 있습니다. 이 외에도 모델이 수행하는 연산의 양과 종류, 파라미터와 중간 데이터를 이동하는 과정이 처리 시간과 전력 소모에 영향을 줍니다[2]. 따라서 AI 모델을 경량화할 때는 파라미터와 액티베이션, 연산량과 데이터 이동뿐 아니라 실제 실행 메모리, 처리 시간, 전력 소모와 발열까지 함께 고려해야 합니다.
파라미터 수나 연산량처럼 모델 구조에서 계산한 지표가 줄었다고 해서, 실제 사용 환경의 비용도 같은 정도로 감소하는 것은 아닙니다. 모델 구조와 대상 하드웨어, 실행 엔진의 조합에 따라 실제 메모리 사용량과 처리 시간, 전력 소모가 달라질 수 있기 때문입니다.
예를 들어 이론적인 연산량을 크게 줄였더라도 변경된 연산을 대상 기기나 실행 엔진이 효율적으로 지원하지 않으면 기대한 만큼 처리 시간이 줄지 않을 수 있습니다. 반대로 파라미터 수나 연산량의 감소가 크지 않더라도 데이터 이동을 줄이고 메모리 접근과 병렬 처리에 유리한 구조로 바꾸면 실제 처리 시간이 크게 줄어들 수 있습니다[3]. 실행 메모리와 전력 소모 역시 모델 구조와 실행 환경의 영향을 받습니다[2].
이러한 이유로 경량화의 효과는 최종적으로 사용할 환경에서 직접 확인해야 합니다. 경량화 전후의 모델을 같은 데이터와 입력 크기, 같은 기기와 실행 환경에서 비교하고, 해당 환경에서 중요한 실행 메모리와 처리 시간, 전력 소모 등을 측정해야 합니다. 실시간 서비스에서는 처리 시간이 중요할 수 있고, 메모리나 배터리가 제한된 기기에서는 실행 메모리와 전력 소모, 발열이 더 중요한 기준이 될 수 있습니다.

그림 2 실행 환경을 고려한 AI 모델 경량화 개념도
이처럼 실제 사용 환경에서 실행 메모리와 처리 시간, 전력 소모가 충분히 줄었다면 경량화에 성공했다고 볼 수 있을까요? 이러한 항목은 경량화를 통해 줄이고자 하는 비용(cost)에 해당하며, 비용 측면에서는 분명 의미 있는 결과입니다. 그러나 그것만으로는 충분하지 않습니다. 자원을 적게 사용하더라도 모델이 원래 기능을 제대로 수행하지 못한다면 실제로 활용하기 어렵기 때문입니다.
이를 확인하는 기준이 품질(quality)입니다. 품질은 경량화된 모델이 목적에 필요한 기능을 얼마나 잘 수행하는지를 의미합니다. 예를 들어 사람과 배경을 구분하는 AI가 매우 빠르게 작동하더라도 얼굴이나 신체를 자주 놓친다면 성공적인 경량화라고 보기 어렵습니다.
따라서 경량화의 성공 여부는 비용과 품질을 함께 고려해 판단해야 합니다. 비용과 품질을 모두 개선할 수 있다면 가장 이상적이지만, 실제로는 두 조건 사이에서 적절한 균형점을 찾아야 하는 경우가 많습니다. 비용을 더 줄이기 위해 경량화를 강하게 적용하면 품질이 낮아질 수 있고, 높은 품질을 유지하려면 어느 정도의 비용을 감수해야 할 수도 있습니다. 핵심은 어느 한쪽을 무조건 최소화하거나 최대화하는 것이 아니라, 실제 사용 목적에 맞게 비용과 품질의 균형을 맞추는 것입니다.

그림 3 품질과 비용을 함께 고려한 AI 모델 경량화
즉, 추론 단계의 AI 모델 경량화는 정해진 사용 환경에서 필요한 품질 수준과 허용 가능한 비용을 먼저 정하고, 두 조건을 함께 만족하도록 모델을 다듬는 과정입니다.
AI 모델의 경량화 방법
AI 모델을 경량화하는 방법은 다양합니다. 대표적인 경량화 기법으로는 양자화, 프루닝, 지식 증류가 있습니다[4].
양자화(quantization)는 파라미터나 액티베이션을 표현하는 숫자의 정밀도를 낮추는 방법입니다. 예를 들어 32비트로 표현하던 숫자를 8비트로 바꾸면 모델 파일의 크기와 메모리 사용량을 줄일 수 있습니다. 대상 기기가 저정밀 연산을 효율적으로 지원한다면 처리 시간과 전력 소모도 함께 줄일 수 있습니다[5]. 다만 정밀도를 지나치게 낮추면 숫자를 단순하게 표현하는 과정에서 발생하는 오차로 인해 품질이 낮아질 수 있습니다.
프루닝(pruning)은 모델에서 상대적으로 중요도가 낮은 파라미터나 연결을 제거하는 방법입니다. 나무에서 불필요한 가지를 잘라내는 것과 비슷합니다. 이를 통해 파라미터 수와 연산량을 줄일 수 있습니다[6]. 그러나 너무 많은 요소를 제거하면 모델의 품질이 낮아질 수 있습니다. 또한 제거 결과가 불규칙한 구조로 남으면 파라미터 수가 줄어도 실제 기기에서 처리 시간이 충분히 개선되지 않을 수도 있습니다.
지식 증류(knowledge distillation)는 성능이 좋은 큰 모델의 판단 방식을 작은 모델이 학습하도록 하는 방법입니다. 큰 모델을 교사 모델, 작은 모델을 학생 모델이라고 부릅니다. 학생 모델은 정답뿐 아니라 교사 모델의 출력도 참고하여 학습합니다. 이를 통해 작은 모델이 혼자 학습했을 때보다 높은 품질을 얻을 수 있습니다[7].
지식 증류에서는 학생 모델을 별도로 학습해야 하므로 추가적인 학습 비용이 필요합니다. 또한 학생 모델의 크기나 구조가 지나치게 제한되면 교사 모델의 판단을 충분히 학습하기 어렵습니다. 다만 이러한 학습의 목적은 학습 비용을 줄이는 것이 아니라, 실제 추론에 사용할 작고 효율적인 모델을 만드는 데 있습니다.
표 1 대표적인 AI 모델 경량화 기법 비교
| 경량화 방법 | 원리 가시화 | 의미 | 특징 | 장점 | 단점 |
| 양자화 Quantization | 수치 정밀도 축소 | 구조 변경 없이 적용 가능 저정밀 연산 지원시 효과적 | 모델 크기 감소 메모리 감소 속도·전력 개선 가능 | 과도한 정밀도 축소시 품질 저하 하드웨어 의존적 | |
| 프루닝 Pruning | ![]() | 중요도 낮은 요소 제거 | 제거 단위에 따라 구조 달라짐 | 파라미터 수 감소 연산량 감소 모델 구조 단순화 | 과도한 제거시 품질 저하 희소 구조는 속도 개선 제한적 |
| 지식 증류 Knowledge Distillation | ![]() | 큰 모델의 지식을 작은 모델에 전달 | 학생 모델 별도 학습 추론시 학생 모델만 사용 | 작은 모델을 단독 학습할 때보다 높은 품질 | 추가 학습 비용 필요 학생 모델이 너무 작으면 한계 |
또한, 기존 모델에 개별 기법을 적용하는 것 외에도 모델 구조 자체를 효율적으로 바꾸거나 처음부터 가벼운 모델을 설계하는 접근도 있습니다. 비용이 큰 연산을 더 단순한 연산으로 교체하거나 층과 채널의 구성을 조정할 수 있습니다. 처음부터 작은 모델을 설계하면서 목표 기기가 효율적으로 처리할 수 있는 구조를 선택하는 방법도 있습니다[8]. 다만 구조를 지나치게 단순화하면 품질이 낮아질 수 있으며, 새로운 모델을 설계하고 학습해야 하는 부담도 발생합니다.
이러한 방법들은 하나씩 사용되기도 하지만 여러 방법을 함께 적용하는 경우도 많습니다. 모델 구조를 단순화한 뒤 양자화를 적용하거나, 프루닝으로 일부 구조를 제거한 뒤 지식 증류를 활용할 수 있습니다. 경량화된 모델의 품질이 목표 수준에 미치지 못하면 파인튜닝을 통해 변경된 모델을 다시 학습하거나, 양자화에서 발생하는 오차를 학습 과정에 반영하여 품질을 보완할 수도 있습니다.
어떤 방법을 조합하고 어느 정도로 적용할지는 모델과 사용 환경에 따라 달라집니다. 각 방법은 줄일 수 있는 비용과 품질에 미치는 영향이 다르므로, 앞에서 정한 품질과 비용의 기준에 맞게 방법과 적용 수준을 조정해야 합니다.
경량화 방법과 적용 수준에 대한 판단은 모델 전체뿐 아니라 모듈(module) 단위에서도 이루어질 수 있습니다. AI 모델은 서로 다른 기능을 담당하는 여러 모듈로 구성되는 경우가 많으며, 모듈마다 사용하는 연산량과 메모리, 최종 품질에 미치는 영향이 다릅니다. 따라서 비용이 큰 모듈은 우선적인 경량화 대상으로 검토하고, 품질에 민감한 모듈은 원래 구조를 더 많이 유지할 수 있습니다. 각 모듈의 특성에 따라 서로 다른 경량화 방법과 적용 강도를 선택하는 것도 가능합니다.
모듈을 경량화한 뒤에는 모듈 자체의 기능 수행 능력뿐 아니라, 이를 전체 모델이나 서비스에 연결했을 때 최종 결과의 품질까지 함께 평가해야 합니다. 개별 모듈의 성능이 다소 낮아지더라도 최종 결과에 미치는 영향이 작고 비용 절감 효과가 크다면 실용적인 경량화로 볼 수 있습니다. 반대로 평균 성능 지표가 높더라도 실제 작업에서 중요한 요소를 반복적으로 놓친다면 적합한 결과라고 보기 어렵습니다.
또한 경량화 효과가 전체 실행 과정에서도 이어지는지 확인해야 합니다. 실제 AI 서비스에는 모델 추론뿐 아니라 전처리·후처리, 데이터 변환, 메모리 복사 등이 함께 작동하므로, 이러한 과정이 새로운 병목이 된다면 함께 개선해야 합니다. 따라서 경량화는 하나의 기법을 일률적으로 적용하는 작업이 아니라, 모델과 모듈의 특성에 맞게 방법과 수준을 조정하고 전체 시스템이 목표한 품질·비용 기준을 만족하는지 검증하는 과정이라 할 수 있습니다.

그림 4 모듈별 경량화 전략의 선택과 평가 과정 예시
마치며
이번 글에서는 AI 모델 경량화의 성공을 판단하는 기준과 양자화·프루닝·지식 증류·효율적인 구조 설계 등 대표적인 방법을 살펴보았습니다.
AI 모델 경량화의 목표는 모델을 가능한 한 작게 만드는 것이 아닙니다. 주어진 환경 안에서 목표 품질을 유지하면서도, 허용 가능한 비용 범위를 충족하도록 모델을 최적화하는 것이 핵심입니다.
다음 글에서는 이번에 살펴본 경량화 기준과 방법이 실제 연구에 어떻게 적용되는지 구체적인 사례와 함께 소개할 예정이니, 많은 관심 부탁드립니다.
참고자료
[1] Stanford Institute for Human-Centered Artificial Intelligence, The 2025 AI Index Report, 2025.
[2] V. Sze, Y.-H. Chen, T.-J. Yang, and J. S. Emer, “Efficient Processing of Deep Neural Networks: A Tutorial and Survey,” Proceedings of the IEEE, 2017.
[3] N. Ma, X. Zhang, H.-T. Zheng, and J. Sun, “ShuffleNet V2: Practical Guidelines for Efficient CNN Architecture Design,” European Conference on Computer Vision (ECCV), 2018.
[4] Y. Cheng, D. Wang, P. Zhou, and T. Zhang, “A Survey of Model Compression and Acceleration for Deep Neural Networks,” arXiv:1710.09282, 2017.
[5] B. Jacob et al., “Quantization and Training of Neural Networks for Efficient Integer-Arithmetic-Only Inference,” IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2018.
[6] S. Han, H. Mao, and W. J. Dally, “Deep Compression: Compressing Deep Neural Networks with Pruning, Trained Quantization and Huffman Coding,” International Conference on Learning Representations (ICLR), 2016.
[7] G. Hinton, O. Vinyals, and J. Dean, “Distilling the Knowledge in a Neural Network,” NIPS Deep Learning Workshop, 2015.
[8] M. Tan et al., “MnasNet: Platform-Aware Neural Architecture Search for Mobile,” IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2019.

KAIST 사이버보안연구센터 AI 기술보안팀 선임연구원으로 AI 및 LLM을 이용한 AI 모델 경량화와 보안 연구를 수행하고 있다.

