AI 에이전트, LLM, AI 어시스턴트 차이점 완벽 정리
LLM은 RAM이 필요한 가중치 파일이며, 어시스턴트는 채팅 인터페이스를, 에이전트는 도구와 반복 루프를 추가합니다. 각 계층별 서버 요구 사항과 자격 증명 관리 방식 및 비용 구조의 차이를 기술적인 관점에서 상세히 설명합니다.
AI 에이전트, LLM, AI 어시스턴트의 차이점은 무엇입니까?
AI 에이전트, LLM, AI 어시스턴트는 하나의 스택을 구성하는 세 가지 계층이며, 이들을 구분하는 방법은 각 계층이 서버에 무엇을 요구하는지 확인하는 것입니다. LLM(Large Language Model)은 RAM과 연산 자원을 필요로 하는 가중치 파일입니다. 어시스턴트는 해당 모델을 채팅 인터페이스로 감싸고 계정과 저장된 기록을 결합한 형태이며, 거의 항상 타인의 하드웨어에서 실행됩니다. 에이전트는 어시스턴트에 도구와 반복 실행 루프가 추가된 형태이며, 자격 증명(credentials)을 보유하고 있기 때문에 항상 켜져 있는 머신에서 실행되어야 합니다.
이 질문에 대한 대부분의 설명은 정의 수준에서 멈춥니다. 하지만 이러한 정의가 중요한 이유는 각 계층마다 과금 방식이 다르기 때문입니다. 하나는 RAM 비용이 발생합니다. 다음은 공개 URL과 TLS(Transport Layer Security) 비용이 발생합니다. 마지막 계층은 자격 증명 비용이 발생하며, 에이전트가 사용한 자격 증명은 사용자가 직접 주기적으로 교체해야 합니다.
LLM은 가중치이며, 가중치에는 RAM이 필요합니다
LLM은 숫자로 이루어진 파일입니다. 파일을 다운로드하면 런타임이 이를 메모리에 로드하고, 한 번에 하나의 요청을 처리합니다. 이 모델의 작동 방식은 단순합니다. 텍스트를 입력하면 텍스트가 출력됩니다. 모델은 호출 사이에 기억을 유지하지 않으며, 내부 시계나 네트워크 접근 권한이 없고 파일을 열 수도 없습니다. LLM이 기억하는 것처럼 보이는 모든 정보는 모델을 호출하는 프로그램이 컨텍스트에 붙여넣은 것입니다.
VPS 요금제를 결정하는 숫자는 해당 파일의 크기입니다. 모델이 실행되는 동안 전체 파일이 메모리에 상주하기 때문입니다. Ollama가 기본으로 제공하는 4-bit 양자화 모델의 경우, 파라미터 10억 개당 약 0.6 GB의 메모리가 필요하며, 여기에 컨텍스트 윈도우와 런타임 자체를 위해 1~2 GB를 추가해야 합니다.
The data behind this chart
[
{
"label": "qwen3:4b",
"download_gb": 2.5,
"ram_gb_needed": 6
},
{
"label": "qwen3:8b",
"download_gb": 5.2,
"ram_gb_needed": 8
},
{
"label": "qwen3:14b",
"download_gb": 9.3,
"ram_gb_needed": 12
},
{
"label": "qwen3:32b",
"download_gb": 20.0,
"ram_gb_needed": 24
}
]qwen3:8b 빌드는 디스크에서 5.2 GB를 차지하며, 스와핑 없이 실행하려면 약 8 GB의 RAM이 필요합니다. 4 GB VPS는 9.3 GB 크기인 qwen3:14b를 로드할 수조차 없으며, 이는 사용자가 단 한 글자도 입력하기 전의 상태입니다. 이 표에서 가장 큰 항목인 qwen3:32b은 약 24 GB가 필요하며, 대부분의 가격표에서 이는 더 높은 요금제와 더 많은 월 이용료를 의미합니다.
메모리에 적재하는 것은 하나의 문제입니다. 속도는 또 다른 문제입니다. CPU 전용 VPS에서는 클럭 속도보다 메모리 대역폭이 병목 현상을 일으키므로, 메모리에 적재된 모델이라도 초당 몇 토큰 정도의 속도로만 답변할 수 있습니다. 이는 밤새 실행되는 작업에는 적합하지만, 대화형 서비스에는 적합하지 않습니다. GPU를 사용하면 이 수치가 약 10배 정도 향상되지만 비용도 함께 상승하므로, 실행하려는 워크로드로 VPS 벤치마크를 수행하고 GPU VPS가 비용 값을 하는 경우를 읽어보고 결정하십시오. 가중치를 실행하는 것부터 시작하려면 자신의 VPS에 Ollama 설치하기를 참조하십시오.
어시스턴트는 LLM과 채팅 인터페이스의 결합입니다
어시스턴트는 모델을 감싸는 제품 계층입니다. ChatGPT와 Claude는 어시스턴트의 예로, 모델, 채팅 창, 계정, 대화 저장 기능, 사용량 제한 등을 포함합니다. 이러한 기능 대부분은 사용자가 제어하는 하드웨어에서 실행되지 않으며, 이것이 호스팅된 어시스턴트가 구독료를 요구하고 로컬 RAM을 사용하지 않는 이유입니다.
자체 호스팅 버전은 로컬 Ollama나 호스팅된 API를 가리키는 Open WebUI와 같은 프론트엔드입니다. 프론트엔드는 가벼운 소프트웨어입니다. 모델이 요구하는 자원 외에 채팅 인터페이스를 위해 약 1 GB의 상주 메모리가 필요합니다. 모델만 있을 때는 필요 없지만 어시스턴트에는 반드시 필요한 것이 공개 URL과 인증서입니다. 휴대폰에서 접속해야 하기 때문입니다. Certbot과 Nginx로 인증서 발급하기를 참고하거나, 여러 애플리케이션 앞단에 Traefik 배치하기를 통해 TLS를 종료하십시오. 아직 프론트엔드를 선택 중이라면 Open WebUI 대안들을 비교해 보십시오.
어시스턴트는 답변을 제공할 뿐 직접 행동하지는 않습니다. 어시스턴트가 셸 명령어를 작성하면 사람이 그 명령어를 읽고 붙여넣을지 결정합니다. 그 사람이 바로 안전 계층이며, 에이전트는 이 안전 계층을 제거하는 존재입니다.
에이전트는 도구와 루프를 추가합니다
에이전트는 함수를 호출하고 그 결과를 읽을 수 있는 보조 도구입니다. 두 가지 요소가 작업을 수행합니다. 첫 번째는 도구로, 모델이 요청할 수 있는 함수에 대한 설명과 이를 실제로 실행하는 사용자의 코드로 구성됩니다. 두 번째는 루프입니다. 프로그램이 모델을 호출하면 모델이 도구를 요청하고, 프로그램은 이를 실행한 뒤 출력값을 대화 내용에 추가하여 모델을 다시 호출합니다. 이 과정은 모델이 완료되었다고 알리거나 제한에 도달할 때까지 반복됩니다.
루프는 일반적인 코드이며, 기본적인 루프는 100줄 미만으로 작성할 수 있습니다. 에이전트가 특별한 이유는 도구가 실제 자격 증명을 가지고 있어 루프 외부의 무언가를 변경할 수 있다는 점입니다. 이 단일 사실이 아래의 모든 호스팅 결정을 좌우합니다. 에이전트 기술과 MCP (model context protocol) 서버는 루프를 다시 작성하지 않고도 에이전트에게 더 많은 도구를 제공하는 두 가지 방법입니다.
- 세션보다 오래 지속됩니다. 채팅은 탭을 닫으면 종료됩니다. 에이전트 실행은 20분 이상 걸릴 수 있으며 노트북이 절전 모드로 전환되어도 유지되어야 하므로, 재부팅 후에도 다시 시작할 수 있도록 systemd 서비스나 타이머에 의해 구동되는 상시 가동 서버에서 실행해야 합니다.
- 비밀 정보를 보유합니다. API 키, SSH 키, 데이터베이스 비밀번호 등이 포함됩니다. 에이전트가 읽을 수 있는 모든 정보는 입력값에 숨겨진 악의적인 명령에 의해 악용될 수 있으므로, 비밀 정보가 에이전트의 접근 범위 밖에 있도록 유지하십시오.
- 비용은 질문이 아니라 루프에 따라 증가합니다. 모든 단계에서 전체 대화 내용을 입력으로 다시 전송하므로, 10단계 실행 시 해당 기록에 대해 10번의 비용이 발생합니다. 이것이 바로 입력 토큰이 에이전트 비용의 대부분을 차지하는 이유이며, 한 번의 실행에 대한 엄격한 비용 제한을 설정해야 하는 이유입니다.
- 쓰기 작업 시 오류가 발생할 수 있습니다. 채팅에서의 잘못된 답변은 다시 읽으면 그만이지만, 루프 내부에서의 잘못된 삭제는 디렉터리 전체를 손실하게 만듭니다. 작업에 필요한 최소한의 권한을 가진 사용자로 실행하고, 코딩 에이전트의 경우 저장소를 제공하기 전에 샌드박스 환경에서 격리하십시오.
각 계층이 서버에 요구하는 사항
The data behind this chart
[
{
"label": "LLM (weights you host)",
"ram_gb": 8,
"gpu": "helps a lot",
"public_url": "no",
"credentials": "none"
},
{
"label": "Assistant (chat surface)",
"ram_gb": 1,
"gpu": "no",
"public_url": "yes",
"credentials": "one login"
},
{
"label": "Agent (tools and a loop)",
"ram_gb": 2,
"gpu": "no",
"public_url": "only for webhooks",
"credentials": "several"
}
]RAM 열을 주의 깊게 확인하십시오. 모델 자체의 크기는 제외되어 있기 때문입니다. 채팅 프론트엔드와 에이전트 런타임은 모두 작은 프로그램입니다. 에이전트가 호스팅된 모델을 호출한다면 2 GB의 RAM으로 충분히 실행할 수 있으며, 저렴한 플랜을 선택하는 것이 타협이 아닌 합리적인 해결책이 됩니다. 모델 가중치를 같은 서버에 올리는 순간 8 GB 모델 라인이 다른 모든 자원 요구 사항을 압도하게 됩니다.
다른 열들도 사람들이 생각하는 것보다 훨씬 중요합니다. 모델 계층만이 GPU를 통해 속도가 향상됩니다. 어시스턴트 계층만이 브라우저가 접근해야 하므로 기본적으로 공개 URL이 필요합니다. 에이전트는 웹훅과 같이 외부에서 호출해야 하는 경우에만 공개 URL이 필요합니다. 또한 에이전트는 several 자격 증명을 보유하는데, 이것이 단순 채팅 창과 에이전트를 구분 짓는 실질적인 차이입니다. 채팅 창은 잘못된 정보를 제공할 수 있습니다. 하지만 에이전트는 잘못된 정보를 바탕으로 실제 행동을 수행할 수 있습니다.
AI 에이전트를 실행하려면 GPU가 필요한가?
아니요, 동일한 머신에서 모델 가중치를 직접 호스팅하는 경우가 아니라면 필요하지 않습니다. 에이전트 루프는 HTTP 요청, JSON 파싱, 서브프로세스 호출로 구성되며, 네트워크 응답을 기다리는 동안 CPU는 거의 유휴 상태로 머뭅니다. GPU 사용 여부는 사실상 LLM 계층에 대한 결정입니다.
따라서 결정을 분리하십시오. 텍스트 데이터가 서버 외부로 유출되어서는 안 된다면, 모델을 올릴 메모리와 실용적인 속도를 위한 GPU 비용을 지불하십시오. 자동화 기능만 필요하다면 토큰 단위로 모델을 대여하고, 그 비용을 가동 시간(uptime)과 백업에 투자하는 것이 좋습니다. 2026년 기준 대부분의 자체 호스팅 에이전트는 호스팅된 모델을 호출하며, 이 방식이 운영 비용 측면에서 더 저렴합니다.
AI 에이전트를 직접 호스팅할 수 있습니까?
네, 가능합니다. 에이전트는 데이터와 자격 증명이 머무는 루프가 위치한 계층이므로 직접 호스팅할 가치가 가장 큽니다. 2 GB RAM, 서비스 관리자, 아웃바운드 네트워크 접근 권한을 갖춘 소규모 VPS로도 실제 에이전트를 구동할 수 있습니다. 루프를 직접 소유하고 싶다면 VPS에서 직접 구축하는 경로를 선택하고, 완성된 도구로 시작하고 싶다면 기성 셀프 호스팅 에이전트 배포를 선택하십시오.
어시스턴트를 직접 호스팅하는 것은 쉽습니다. 컨테이너 하나와 인증서 하나면 충분합니다. 모델을 직접 호스팅하는 것은 비용이 많이 드는 작업이며, CPU에서 토큰이 기어 나오는 속도를 확인한 뒤 많은 사용자가 포기하는 지점이기도 합니다. 데이터가 서버 외부로 유출되어서는 안 되거나, 토큰당 과금 방식이 부담스러울 정도로 사용량이 많을 때 모델 가중치를 직접 호스팅하십시오. 그 외의 경우에는 에이전트가 API를 호출하게 하고, 핵심적인 부분만 로컬에 유지하는 것이 좋습니다.
ChatGPT는 AI 에이전트입니까?
채팅 제품이 사용자에게 먼저 묻지 않고 도구를 호출하여 그 결과를 바탕으로 동작하는 순간, 해당 제품은 에이전트가 됩니다. 이 기준에 따르면 브라우징, 코드 실행, 커넥터 기능을 갖춘 호스팅형 어시스턴트는 에이전트입니다. 사용자 입장에서의 차이점은 루프가 어디에서 실행되며 누구의 자격 증명을 사용하는가에 있습니다. 호스팅형 제품에서는 이 두 가지 모두 공급업체에 속합니다. 자체 서버에서는 이 두 가지 모두 사용자의 소유이며, 새벽 3시에 루프가 수행하는 모든 동작에 대한 책임 또한 사용자에게 있습니다.
반응형, 계획형 및 멀티 에이전트
요약 자료에서는 에이전트의 유형을 7가지로 분류하곤 합니다. 대부분은 마케팅 용어에 불과합니다. 코드 작성 방식에 영향을 주는 구분은 2가지이며, 비용에 영향을 주는 구분은 1가지입니다. 반응형 에이전트는 도구를 호출하고 결과를 읽은 뒤 응답합니다. 계획형 에이전트는 먼저 계획을 작성한 후 이를 수행하는데, 이는 긴 작업에서 더 안정적이지만 매 단계마다 계획을 다시 전송해야 하므로 토큰 비용이 더 많이 발생합니다. 멀티 에이전트 구성은 하나의 에이전트가 다른 에이전트를 시작하게 하며, 토큰 소비량과 실패 가능성을 동시에 증가시킵니다. 따라서 4개의 소스를 동시에 검색하는 경우처럼 하위 작업이 완전히 독립적일 때만 효과적입니다. 반응형으로 시작하십시오. 작업이 길어지면 계획형을 추가하십시오. 멀티 에이전트는 가장 마지막에 고려하십시오. 더 넓은 지도를 보려면 2026년 AI 에이전트에 대해 배울 가치가 있는 것을 참조하십시오.
현재 실행 중인 레이어를 확인하는 방법
서버에서 어떤 프로세스가 메모리를 점유하고 있는지 확인합니다.
free -h
ps -eo rss,comm --sort=-rss | head -5최상단 행에 ollama 또는 llama-server가 수 기가바이트의 RSS(Resident Set Size, 프로세스가 실제로 점유하는 메모리 크기)를 차지하고 있다면, 모델을 직접 호스팅하고 있는 것입니다. 수백 메가바이트를 넘는 프로세스가 없고 API 비용만 계속 증가한다면, 에이전트나 어시스턴트를 호스팅하면서 모델을 대여해 사용하고 있는 상태입니다. 모든 작업이 브라우저 탭 내에서 이루어져 해당 목록이 비어 있다면, 귀하는 어시스턴트의 고객입니다. 이는 귀하를 대신하여 동작하는 소프트웨어가 필요하기 전까지는 적절한 운영 방식입니다.
어떤 것을 실행하시겠습니까?
- 데이터를 비공개로 유지하려면 모델을 실행하십시오: Ollama로 LLM 자체 호스팅하기, 그 후 사용자가 1명에서 10명으로 늘어나면 Ollama와 vLLM의 런타임 비교를 수행하십시오.
- 루프와 도구를 직접 제어하려면 에이전트를 구축하십시오: VPS에서 나만의 AI 에이전트 구축하기.
- 오늘 저녁 바로 작동하는 결과물을 원한다면, 직접 호스팅할 가치가 있는 에이전트에서 완성된 것을 배포하십시오.
- 아직 기반이 되는 서버가 없다면, VPS가 실제로 제공하는 것부터 시작하십시오.
FAQ
AI 에이전트는 단순히 추가 단계가 포함된 LLM인가요?
추가 단계가 바로 제품의 핵심입니다. LLM은 텍스트를 입력받아 텍스트를 출력할 뿐입니다. 에이전트는 LLM을 호출할 수 있는 도구와 이를 반복적으로 실행하는 루프로 감싸며, 이러한 도구는 자격 증명을 포함하므로 파일, 데이터베이스 또는 라이브 서비스를 변경할 수 있습니다. 이것이 바로 에이전트에는 항상 켜져 있는 머신, 서비스 관리자, 보안 정책이 필요한 이유입니다. 반면 LLM은 답변을 생성하는 동안 가중치를 유지할 정도의 메모리만 있으면 됩니다.
AI 에이전트를 실행하려면 GPU가 필요한가요?
에이전트 자체에는 필요하지 않습니다. 루프는 HTTP 요청, JSON 처리, 서브프로세스 호출로 구성되며, 이는 네트워크 응답을 기다리는 동안 어떤 CPU로도 충분히 처리할 수 있습니다. 모델 가중치를 직접 호스팅하고 초당 수 토큰 이상의 성능을 원할 때만 GPU가 필요합니다. 호스팅된 모델을 호출하는 에이전트는 GPU가 없는 소규모 VPS에서도 원활하게 실행됩니다.
AI 에이전트를 위한 VPS에는 RAM이 얼마나 필요한가요?
에이전트가 호스팅된 모델을 호출하는 경우 약 2 GB가 필요합니다. 런타임, 의존성 패키지, 소규모 로컬 데이터베이스만 메모리에 상주하기 때문입니다. 가중치를 직접 호스팅한다면 모델 용량을 추가해야 합니다. qwen3:8b 하나만으로도 약 8 GB가 필요하므로, 올인원 서버는 이 수치에서 시작하여 선택하는 모델에 따라 요구 사양이 증가합니다.
AI 어시스턴트를 직접 호스팅하여 대화 내용을 비공개로 유지할 수 있나요?
네, 하지만 모든 것을 결정짓는 한 가지 주의 사항이 있습니다. Open WebUI와 같은 자체 호스팅 프론트엔드는 계정과 대화 기록을 서버에 보관합니다. 대화 내용 자체가 비공개로 유지되려면 그 뒤에 있는 모델 또한 로컬에 있어야 합니다. 동일한 프론트엔드를 호스팅된 API에 연결하면 메시지를 보낼 때마다 텍스트가 서버 외부로 전송되므로, 기록은 보관할 수 있어도 개인 정보 보호는 보장되지 않습니다.
AI 에이전트와 챗봇의 차이점은 무엇인가요?
챗봇은 답변을 하고 멈춥니다. 에이전트는 다음에 무엇을 할지 결정하고, 도구를 호출하고, 결과를 읽고, 작업이 완료되거나 제한에 도달할 때까지 다시 결정을 내립니다. 실질적인 구분 기준은 다음과 같습니다. 답변과 실행 사이에 사람이 버튼을 누르지 않아도 소프트웨어가 무언가를 변경할 수 있다면 그것은 에이전트이며, 그에 따른 호스팅 환경과 안전 장치가 필요합니다.