SSD Nodes Learn 🎉 VPS từ $4.99/tháng
Hướng dẫn Matt ConnorBởi Matt Connor · Cập nhật ngày 2026-08-07

AI agent, LLM và AI assistant khác nhau thế nào?

Phân biệt LLM, AI assistant và AI agent theo chi phí server: LLM cần RAM, assistant cần chat và TLS, còn agent cần tool, credentials và máy luôn bật.

AI agent, LLM và AI assistant khác nhau như thế nào?

AI agent, LLM và AI assistant là 3 lớp trong cùng một stack. Cách phân biệt chúng là xem mỗi lớp cần gì từ server. LLM (large language model) là một file chứa các weight, cần RAM và năng lực tính toán. AI assistant là model đó được bọc trong một giao diện chat, có account và lịch sử đã lưu, gần như luôn chạy trên hardware của người khác. AI agent là assistant có thêm các tool và một vòng lặp xử lý. Nó cũng giữ credentials, nên phải chạy trên một máy luôn bật.

Phần lớn nội dung về chủ đề này chỉ dừng ở định nghĩa. Các định nghĩa chỉ quan trọng vì mỗi lớp tạo ra một loại chi phí khác nhau. Một lớp cần RAM. Lớp tiếp theo cần public URL và TLS (transport layer security). Lớp cuối cùng cần credentials. Một credential mà agent đã sử dụng là credential bạn phải rotate.

LLM là tập trọng số, mà trọng số cần RAM

LLM là một file chứa các số. Bạn tải file đó xuống, runtime nạp nó vào bộ nhớ, rồi xử lý từng request một. Giao diện hoạt động rất rõ ràng: đưa text vào, nhận text ra. Model không có bộ nhớ giữa các lần gọi, không có clock, không có quyền truy cập network và không thể mở file. Mọi thứ mà LLM có vẻ đang nhớ thực ra đều được chương trình gọi nó đưa vào context.

Kích thước file đó quyết định VPS plan của bạn, vì toàn bộ file phải nằm trong bộ nhớ khi model chạy. Với quantisation 4-bit mà Ollama dùng mặc định, hãy tính khoảng 0.6 GB cho mỗi tỷ parameter, sau đó cộng thêm 1 hoặc 2 GB cho context window và chính runtime.

ChartQwen3 download size and the RAM the box needs (published sizes, ollama.com, August 2026)
The data behind this chart
[
  {
    "label": "qwen3:4b",
    "download_gb": 2.5,
    "ram_gb_needed": 6
  },
  {
    "label": "qwen3:8b",
    "download_gb": 5.2,
    "ram_gb_needed": 8
  },
  {
    "label": "qwen3:14b",
    "download_gb": 9.3,
    "ram_gb_needed": 12
  },
  {
    "label": "qwen3:32b",
    "download_gb": 20.0,
    "ram_gb_needed": 24
  }
]

Bản build qwen3:8b chiếm 5.2 GB trên disk và cần khoảng 8 GB RAM để chạy mà không phải dùng swap. VPS 4 GB sẽ không nạp được qwen3:14b, vốn đã chiếm 9.3 GB trước khi bạn nhập một từ nào vào đó. Dòng lớn nhất ở đây, qwen3:32b, cần khoảng 24 GB, nên trong hầu hết bảng giá đây là một plan khác và một mức phí hằng tháng khác.

Đủ chỗ trong memory là một vấn đề. Tốc độ là vấn đề khác. Trên VPS chỉ dùng CPU, bottleneck nằm ở memory bandwidth chứ không phải clock speed, nên model dù vừa memory vẫn có thể chỉ trả lời vài token mỗi giây. Mức này phù hợp với job chạy qua đêm nhưng gây khó chịu khi chat. GPU có thể tăng con số đó khoảng một bậc độ lớn, đồng thời cũng làm bill tăng, nên hãy quyết định dựa trên phép đo: benchmark VPS với workload bạn định chạy và đọc khi nào GPU VPS xứng đáng với chi phí. Để bắt đầu chạy weights, hãy xem Ollama trên VPS của bạn.

Trợ lý là LLM đi kèm giao diện chat

Trợ lý là lớp sản phẩm bao quanh model. ChatGPT và Claude là các trợ lý: một model, cửa sổ chat, tài khoản, các cuộc trò chuyện đã lưu và giới hạn tốc độ. Gần như không thành phần nào trong số đó chạy trên phần cứng bạn kiểm soát. Vì vậy, trợ lý được host sẵn cần gói thuê bao nhưng không dùng RAM của bạn.

Phiên bản self-host là một front end như Open WebUI, trỏ đến Ollama cục bộ hoặc một API được host sẵn. Front end là phần mềm nhỏ. Hãy dự kiến khoảng 1 GB RAM resident cho giao diện chat, chưa tính phần model cần. Thành phần này cần một URL public và một certificate, còn bare model thì không, vì bạn muốn truy cập từ điện thoại: cấp certificate bằng Certbot và Nginx, hoặc terminate TLS tại Traefik đặt trước nhiều app. Nếu bạn vẫn đang chọn front end, hãy xem các lựa chọn thay thế cho Open WebUI.

Trợ lý chỉ trả lời. Nó không thực hiện hành động. Khi trợ lý viết một shell command, người dùng sẽ đọc command đó và quyết định có paste vào hay không. Người dùng là một lớp an toàn, còn agent là thành phần loại bỏ lớp này.

Agent bổ sung tools và một loop

Agent là một assistant có thể gọi các function rồi đọc kết quả trả về. Hai phần thực hiện công việc này. Phần đầu là tool: mô tả về một function mà model có thể yêu cầu, cùng với code của bạn để thực thi function đó. Phần thứ hai là loop: chương trình của bạn gọi model, model yêu cầu một tool, chương trình chạy tool đó, thêm output vào conversation rồi gọi lại model. Quy trình lặp lại cho đến khi model cho biết đã hoàn tất hoặc một giới hạn dừng quy trình.

Loop chỉ là code thông thường, và một loop cơ bản có thể dài chưa đến một trăm dòng. Loop trở thành agent vì các tool có credential thực, cho phép loop thay đổi những thứ bên ngoài chính nó. Đây là yếu tố chi phối mọi quyết định hosting bên dưới. Kỹ năng của agentserver MCP (model context protocol) là hai cách cung cấp thêm tool cho agent mà không phải viết lại loop.

Mỗi lớp cần gì trên máy chủ

ChartWhat each layer asks of a server you own
The data behind this chart
[
  {
    "label": "LLM (weights you host)",
    "ram_gb": 8,
    "gpu": "helps a lot",
    "public_url": "no",
    "credentials": "none"
  },
  {
    "label": "Assistant (chat surface)",
    "ram_gb": 1,
    "gpu": "no",
    "public_url": "yes",
    "credentials": "one login"
  },
  {
    "label": "Agent (tools and a loop)",
    "ram_gb": 2,
    "gpu": "no",
    "public_url": "only for webhooks",
    "credentials": "several"
  }
]

Đọc kỹ cột RAM vì cột này không tính model. Chat front end và agent runtime đều là các chương trình nhỏ. Nếu agent gọi model được host bên ngoài, 2 GB RAM là đủ để chạy nó, và một gói giá rẻ là lựa chọn thực tế chứ không phải giải pháp tạm bợ. Nếu đặt weights trên cùng máy chủ, dòng model 8 GB sẽ chiếm phần lớn tài nguyên so với mọi thành phần khác.

Các cột còn lại quan trọng hơn nhiều người nghĩ. Chỉ model layer chạy nhanh hơn khi có GPU. Chỉ assistant layer thường cần public URL, vì trình duyệt phải truy cập được vào đó; agent chỉ cần public URL khi có thành phần bên ngoài phải gọi vào, chẳng hạn như webhook. Ngoài ra, agent lưu giữ several thông tin xác thực. Đây mới là khác biệt thực sự giữa agent và cửa sổ chat. Cửa sổ chat có thể trả lời sai. Agent có thể trả lời sai rồi thực hiện hành động dựa trên câu trả lời đó.

Bạn có cần GPU để chạy AI agent không?

Không, trừ khi bạn cũng host model weights trên cùng máy đó. Vòng lặp của agent chỉ gồm các HTTP request, phân tích JSON và gọi subprocess. CPU gần như idle trong lúc chờ network. Câu hỏi về GPU thực chất là câu hỏi về lớp LLM.

Vì vậy, hãy tách riêng quyết định này. Nếu text không được rời khỏi máy của bạn, hãy trả tiền cho đủ memory để chứa model và, nếu muốn tốc độ sử dụng được, trả thêm cho GPU để chạy model. Nếu bạn chỉ cần automation, hãy thuê model theo token và dùng ngân sách cho uptime và backup. Phần lớn agent self-hosted trong 2026 gọi đến model được host bên ngoài, nên chi phí vận hành thấp hơn.

Bạn có thể tự host một AI agent không?

Có. Agent là lớp đáng tự host nhất vì vòng lặp là nơi dữ liệu và credential của bạn được sử dụng. Một VPS nhỏ với 2 GB RAM, một service manager và quyền truy cập network outbound có thể chạy một agent thực sự. Chọn tự xây dựng trên VPS nếu bạn muốn tự kiểm soát vòng lặp, hoặc triển khai một trong các agent self-host có sẵn nếu bạn muốn bắt đầu từ một hệ thống đã hoàn thiện.

Tự host assistant khá dễ: chỉ cần một container và một certificate. Tự host model mới là phần tốn kém. Đây cũng là phần nhiều người bỏ cuộc sau khi thấy token được xử lý chậm chạp trên CPU. Hãy tự host weights khi dữ liệu không được phép rời khỏi máy, hoặc khi khối lượng sử dụng khiến chi phí tính theo token trở nên quá cao. Nếu không, hãy để agent gọi API và giữ các phần quan trọng chạy cục bộ.

ChatGPT có phải là AI agent không?

Một sản phẩm chat trở thành agent ngay khi nó có thể gọi một tool và thực hiện hành động dựa trên kết quả đó mà không hỏi bạn trước. Theo tiêu chí này, các trợ lý được host có khả năng duyệt web, thực thi mã hoặc kết nối với dịch vụ khác đều là agent. Điểm khác biệt đối với bạn là vòng lặp đó chạy ở đâu và sử dụng credential của ai. Với sản phẩm được host, cả hai đều thuộc về nhà cung cấp. Trên server của bạn, cả hai thuộc về bạn, cùng với trách nhiệm đối với mọi việc vòng lặp đó thực hiện lúc 3 giờ sáng.

Phản hồi, lập kế hoạch và đa agent

Các bài tổng hợp thường liệt kê bảy loại agent. Phần lớn các loại này chỉ là cách gọi mang tính marketing. Có hai khác biệt làm thay đổi code bạn viết, và một khác biệt làm thay đổi chi phí. Reactive agent gọi một tool, đọc kết quả rồi trả lời. Planning agent viết plan trước rồi mới thực hiện từng bước. Cách này ổn định hơn khi xử lý tác vụ dài nhưng tốn nhiều token hơn, vì plan được gửi lại ở mỗi bước. Mô hình multi-agent cho phép một agent khởi chạy các agent khác. Cách này đồng thời làm tăng số token sử dụng và số tình huống có thể fail, nên chỉ đáng dùng khi các tác vụ con thực sự độc lập, chẳng hạn tìm kiếm 4 nguồn cùng lúc. Hãy bắt đầu với reactive. Thêm planning khi các lần chạy trở nên dài. Chỉ dùng multi-agent sau cùng. Để xem bức tranh tổng thể hơn, hãy xem những gì đáng học về AI agent trong 2026.

Cách xác định bạn thực sự đang chạy ở lớp nào

Trên server, hãy kiểm tra process nào đang sử dụng bộ nhớ.

free -h
ps -eo rss,comm --sort=-rss | head -5

Nếu dòng đầu tiên là ollama hoặc llama-server và process đó đang chiếm vài gigabyte RSS (resident set size, tức lượng bộ nhớ mà process thực sự sử dụng), bạn đang tự host model. Nếu không có process nào vượt quá vài trăm megabyte nhưng chi phí API vẫn tăng, bạn đang host một agent hoặc assistant và thuê model. Nếu danh sách đó trống vì mọi thứ đều chạy trong một tab trình duyệt, bạn đang sử dụng một assistant như khách hàng. Đây là lựa chọn hoàn toàn phù hợp cho đến khi bạn cần phần mềm có thể hành động thay bạn.

Bạn muốn triển khai hướng nào?

FAQ

AI agent chỉ là LLM có thêm vài bước xử lý phải không?

Các bước bổ sung đó chính là phần tạo nên sản phẩm. LLM chuyển văn bản thành văn bản và không làm gì khác. Agent bao quanh LLM bằng các tool mà nó có thể gọi và một vòng lặp liên tục gọi các tool đó. Các tool này mang theo credential, vì vậy output có thể thay đổi một file, database hoặc service đang chạy. Vì thế, agent cần một máy luôn bật, service manager và chính sách quản lý secrets. LLM chỉ cần đủ memory để chứa weights trong lúc trả lời.

Tôi có cần GPU để chạy AI agent không?

Không cần cho agent. Vòng lặp này gồm các HTTP request, xử lý JSON và gọi subprocess. CPU nào cũng xử lý được trong lúc chờ network. Bạn chỉ cần GPU khi tự host model weights và muốn model tạo nhiều hơn vài token mỗi giây. Agent gọi model được host sẵn có thể chạy ổn định trên một VPS nhỏ hoàn toàn không có GPU.

VPS cần bao nhiêu RAM để chạy AI agent?

Khoảng 2 GB khi agent gọi model được host sẵn, vì nó chỉ chứa runtime, các dependency và một database local nhỏ. Nếu bạn tự host weights, hãy cộng thêm model: riêng qwen3:8b đã cần khoảng 8 GB. Vì vậy, một máy all-in-one bắt đầu từ mức đó và tăng lên tùy model bạn chọn.

Tôi có thể tự host AI assistant và giữ các cuộc hội thoại riêng tư không?

Có, nhưng có một điều kiện quyết định tất cả. Front end tự host như Open WebUI lưu account và history trên server của bạn. Bản thân các cuộc hội thoại chỉ riêng tư khi model phía sau cũng chạy local. Nếu trỏ cùng front end đó đến một hosted API, nội dung vẫn rời khỏi máy của bạn sau mỗi message. Khi đó bạn giữ được history nhưng không giữ được privacy.

AI agent khác chatbot ở điểm nào?

Chatbot trả lời rồi dừng. Agent quyết định bước tiếp theo, gọi một tool, đọc kết quả rồi lại quyết định, cho đến khi hoàn thành công việc hoặc bị một giới hạn dừng lại. Cách kiểm tra thực tế là: nếu phần mềm có thể thay đổi thứ gì đó mà không cần con người bấm nút giữa câu trả lời và hành động, thì đó là agent. Agent cần hạ tầng hosting và các guardrail đi kèm.