ChatGPT, Gemini và nhiều trợ lý AI phổ biến hoạt động chủ yếu theo mô hình AI Online: dữ liệu được gửi tới hạ tầng cloud để xử lý. Ngược lại, Local AI cho phép chạy mô hình trực tiếp trên CPU, GPU hoặc NPU của máy tính. Hai cách tiếp cận khác nhau rõ rệt về bảo mật dữ liệu, yêu cầu Internet, tốc độ, chi phí, khả năng mở rộng và cấu hình phần cứng cần thiết.
AI Online phù hợp nếu muốn sử dụng model lớn, không muốn đầu tư GPU mạnh và cần các dịch vụ luôn được nhà cung cấp cập nhật. Local AI phù hợp nếu ưu tiên dữ liệu nằm trên thiết bị, cần làm việc khi mất Internet, muốn tự chọn model hoặc cần một hệ thống AI nội bộ có khả năng kiểm soát cao. Đổi lại, Local AI yêu cầu đủ RAM, VRAM, SSD và sức mạnh xử lý. Trong thực tế, nhiều người dùng nên kết hợp cả hai thay vì buộc phải chọn một bên.
Chạy inference trên máy giúp dữ liệu không cần gửi tới dịch vụ cloud, nhưng người dùng vẫn phải tự chịu trách nhiệm về malware, quyền truy cập máy, mã hóa ổ đĩa, API local, bản cập nhật model và bảo mật hệ điều hành. Local chỉ thay đổi nơi dữ liệu được xử lý, không loại bỏ mọi rủi ro bảo mật.
AI Online là gì?
AI Online hay Cloud AI là mô hình trong đó người dùng gửi prompt, file hoặc dữ liệu tới máy chủ của nhà cung cấp thông qua Internet.
Máy chủ cloud thực hiện inference và trả kết quả lại cho thiết bị.
Các dịch vụ dạng này có lợi thế là người dùng không phải tự mua GPU đủ lớn để chứa model.
Cloud provider có thể cung cấp:
- Model rất lớn.
- GPU/datacenter chuyên dụng.
- Khả năng mở rộng theo tải.
- Cập nhật model tự động.
- Web search.
- Agent.
- Storage và collaboration.
Local AI là gì?
Local AI là cách chạy model trực tiếp trên thiết bị của người dùng.
Model có thể được tải về ổ cứng và inference bằng:
- CPU.
- GPU NVIDIA.
- GPU AMD trên môi trường được hỗ trợ.
- NPU trên một số máy AI PC.
- Unified Memory trên một số nền tảng.
Một trong những nền tảng phổ biến để chạy LLM local là Ollama.
Trên Windows, Ollama hiện chạy dưới dạng ứng dụng native và cung cấp API local tại:
http://localhost:11434
Điều này cho phép các ứng dụng khác trên máy gọi model local tương tự như gọi một AI API.
Bảng so sánh AI Online và Local AI
Khác biệt số 1 – Dữ liệu được xử lý ở đâu?
Đây là khác biệt quan trọng nhất.
AI Online
Prompt hoặc dữ liệu phải được truyền đến hạ tầng của nhà cung cấp để inference.
Điều này không đồng nghĩa mọi dịch vụ cloud đều sử dụng dữ liệu của bạn để train. Chính sách phụ thuộc nhà cung cấp, loại tài khoản và cài đặt.
Ví dụ với ChatGPT dành cho người dùng cá nhân, OpenAI hiện cung cấp Data Controls cho phép tắt việc sử dụng các cuộc trò chuyện mới để cải thiện model. Temporary Chat cũng không được dùng để train model.
Local AI
Nếu chạy model hoàn toàn local, prompt có thể được xử lý ngay trên thiết bị.
Ollama hiện nêu rõ rằng khi chạy local, Ollama không nhìn thấy prompt hoặc dữ liệu của người dùng.
Ollama cũng cho phép tắt toàn bộ cloud features để chạy ở chế độ local-only.
Khác biệt số 2 – Local AI có chạy khi mất Internet không?
Có, nếu:
- Model đã được tải xuống máy.
- Ứng dụng không phụ thuộc dịch vụ cloud.
- Các tool liên quan cũng hoạt động offline.
Ví dụ Ollama hiện hỗ trợ local-only mode và inference vẫn có thể hoạt động sau khi model đã nằm trên thiết bị.
Điều này hữu ích tại:
- Nhà máy.
- Nông trại.
- Máy tính không được phép ra Internet.
- Môi trường air-gapped.
- Khu vực mạng không ổn định.
Trong khi đó, AI cloud cần kết nối Internet để gửi yêu cầu tới server.
Khác biệt số 3 – AI Online có cần card màn hình mạnh không?
Thông thường không.
Nếu dùng một chatbot cloud, GPU xử lý model nằm trong datacenter của nhà cung cấp.
Vì vậy một laptop văn phòng vẫn có thể dùng model AI rất lớn miễn là:
- Trình duyệt chạy ổn.
- Có đủ RAM cho hệ điều hành.
- Internet ổn định.
Đây là lợi thế rất lớn của Cloud AI.
Khác biệt số 4 – Local AI phụ thuộc RAM và VRAM
Khi chạy model trên máy, weights và runtime phải nằm trong RAM, VRAM hoặc được chia giữa CPU/GPU.
Model càng lớn thì yêu cầu bộ nhớ càng tăng.
Đây chỉ là định hướng. Memory thực tế còn phụ thuộc:
- Quantization.
- Context length.
- KV cache.
- Runtime.
- GPU offload.
- Số model chạy đồng thời.
Khác biệt số 5 – Tốc độ phản hồi
Local AI
Có thể có latency rất thấp vì dữ liệu không phải đi qua Internet.
Tuy nhiên tốc độ token/giây bị giới hạn bởi chính phần cứng của bạn.
Nếu model quá lớn nhưng máy chỉ có CPU yếu hoặc thiếu VRAM, Local AI có thể chậm hơn cloud rất nhiều.
AI Online
Cloud có thể sử dụng GPU datacenter mạnh hơn đáng kể, nhưng phải cộng thêm:
- Độ trễ mạng.
- Thời gian server xử lý.
- Tải hệ thống.
Vì vậy không thể nói Local luôn nhanh hơn hay Cloud luôn nhanh hơn.
Khác biệt số 6 – Model nào mạnh hơn?
Cloud thường có lợi thế khi cần những frontier model rất lớn.
Người dùng có thể truy cập model mạnh mà không cần mua workstation trị giá hàng chục hoặc hàng trăm triệu đồng.
Local AI lại phù hợp với:
- Model open-weight.
- Model distilled.
- Model quantized.
- Small Language Model.
- Model chuyên biệt cho một workflow.
Một model nhỏ được chọn đúng cho tác vụ có thể đủ tốt để tóm tắt tài liệu, trích xuất dữ liệu, phân loại văn bản, viết code cơ bản hoặc chạy chatbot nội bộ. Không phải mọi công việc đều cần frontier model lớn nhất.
Khác biệt số 7 – Chi phí
AI Online
Thường có các mô hình:
- Free.
- Subscription hàng tháng.
- API trả theo token.
- Enterprise license.
Ưu điểm là chi phí ban đầu thấp.
Nhược điểm: nếu chạy automation với lượng token rất lớn, chi phí API có thể tích lũy theo thời gian.
Local AI
Chi phí thường tập trung vào:
- GPU.
- RAM.
- SSD.
- PSU.
- Điện năng.
- Bảo trì phần cứng.
Sau khi đã có phần cứng, inference local có thể không phát sinh phí token cho model tự host.
Nhưng điều đó không có nghĩa “miễn phí”: điện, khấu hao và thời gian quản trị hệ thống vẫn là chi phí.
Khác biệt số 8 – Bảo trì và cập nhật
Cloud
Nhà cung cấp thường chịu trách nhiệm lớn hơn về:
- Hạ tầng.
- GPU.
- Runtime.
- Model deployment.
- Scaling.
Local
Người dùng phải quan tâm nhiều hơn tới:
- Driver GPU.
- Runtime.
- Phiên bản model.
- Dung lượng SSD.
- Backup.
- Security update.
- Khả năng tương thích.
Đây là phần chi phí vận hành thường bị bỏ qua khi so sánh.
Khác biệt số 9 – Khả năng mở rộng
Một máy Local AI có giới hạn vật lý:
- Số GPU.
- VRAM.
- RAM.
- PSU.
- Băng thông PCIe.
Nếu từ một người dùng tăng lên 100 người dùng, hệ thống local có thể phải chuyển thành server AI hoặc cluster.
Cloud thường dễ mở rộng hơn vì người dùng có thể tăng tài nguyên mà không cần mua và lắp phần cứng ngay.
Local AI có thực sự riêng tư hơn?
Nếu inference chạy hoàn toàn trên thiết bị và không sử dụng web search, cloud model hoặc connector bên ngoài, dữ liệu có thể không cần rời khỏi máy.
Microsoft hiện mô tả Local AI/on-device processing là lựa chọn có lợi thế về privacy vì dữ liệu có thể được giữ trên thiết bị.
Microsoft Foundry Local cũng được công bố là chạy inference hoàn toàn on-device; input và output không rời khỏi máy.
Tuy nhiên cần phân biệt:
Ollama có hoàn toàn Local không?
Có thể.
Ollama hiện hỗ trợ cả:
- Local models.
- Cloud models.
Nếu muốn local-only, Ollama hiện cho phép vô hiệu hóa cloud features.
Khi đó người dùng sẽ mất:
- Ollama cloud models.
- Web search thông qua cloud.
nhưng model local vẫn có thể hoạt động.
Local AI có dùng được DeepSeek không?
Có nhiều model DeepSeek và model distilled liên quan có thể được chạy trên các runtime local phù hợp.
Nhưng cần hiểu:
“DeepSeek” không phải một kích thước model duy nhất.
Một bản nhỏ hoặc quantized có thể chạy trên PC cá nhân, trong khi model hàng trăm tỷ tham số có thể đòi hỏi server hoặc nhiều GPU.
Vì vậy trước khi build PC cần xác định:
- Model cụ thể.
- Quantization.
- Context.
- Tốc độ token mong muốn.
- Số người dùng đồng thời.
PC văn phòng 16GB RAM có chạy Local AI được không?
Có với model nhỏ.
Một máy 16GB RAM có thể phù hợp để:
- Thử chatbot nhỏ.
- Tóm tắt văn bản.
- Học Ollama.
- Chạy một số model 3B–7B quantized phù hợp.
Nhưng nếu muốn:
- 14B.
- 32B.
- Context dài.
- Nhiều model cùng lúc.
32GB, 64GB hoặc cao hơn sẽ thực dụng hơn tùy workload.
Không có VGA rời có chạy Local AI được không?
Có.
Nhiều runtime có thể inference bằng CPU.
Nhược điểm là:
- Tốc độ thường thấp hơn GPU phù hợp.
- Model lớn có thể rất chậm.
- CPU và RAM chịu tải cao.
Nếu chỉ cần thử AI local, không nhất thiết mua GPU ngay.
Nếu dùng hằng ngày, GPU có VRAM phù hợp thường đem lại trải nghiệm tốt hơn.
NPU có thay thế GPU cho Local AI không?
Không nên xem NPU và GPU là hai phần cứng hoàn toàn thay thế nhau.
NPU được thiết kế cho các tác vụ AI tiết kiệm điện trên thiết bị, trong khi GPU vẫn có lợi thế lớn với nhiều workload LLM, image generation và model nặng.
Microsoft hiện sử dụng NPU cho nhiều Windows AI API trên Copilot+ PC, trong khi Foundry Local và Windows ML có thể hỗ trợ các cấu hình CPU/GPU/NPU khác nhau tùy tính năng.
AI Online phù hợp với ai?
- Người dùng phổ thông.
- Sinh viên không có GPU mạnh.
- Dân văn phòng.
- Người cần frontier model.
- Người cần web search/research.
- Doanh nghiệp cần scale nhanh.
- Team muốn giảm công việc quản trị hạ tầng.
Local AI phù hợp với ai?
- Developer.
- Người cần AI offline.
- Doanh nghiệp có tài liệu nội bộ nhạy cảm.
- Người muốn tự chọn model.
- Người xây chatbot nội bộ.
- Người muốn học về LLM và inference.
- Workflow lặp lại lớn muốn giảm chi phí API.
Có nên dùng mô hình Hybrid AI?
Đây thường là hướng thực dụng nhất.
Hybrid AI nghĩa là:
- Ưu tiên chạy local khi model local đủ xử lý.
- Chỉ gọi cloud khi task quá khó hoặc cần model lớn.
Microsoft hiện cũng mô tả kiến trúc kết hợp local/on-device và cloud là một lựa chọn hợp lý cho ứng dụng AI: ưu tiên xử lý local trên phần cứng phù hợp và fallback sang cloud khi cần.
Ví dụ Hybrid AI cho doanh nghiệp
Giả sử công ty có hàng nghìn tài liệu nội bộ.
Có thể xây workflow:
Local AI có thể dùng để làm gì trong doanh nghiệp?
- Tìm kiếm tài liệu nội bộ.
- Tóm tắt quy trình.
- Phân loại ticket.
- Trích xuất dữ liệu từ văn bản.
- Viết nháp nội dung.
- Chat với knowledge base.
- Code assistant nội bộ.
- Tạo dữ liệu có cấu trúc.
Không phải workload nào cũng cần GPU cao cấp. Các model nhỏ có thể đủ cho nhiều tác vụ định dạng, phân loại và extraction.
Local AI có phù hợp cho Stable Diffusion không?
Có.
Image generation là một ứng dụng phổ biến của Local AI.
Người dùng có thể chạy:
- Stable Diffusion.
- SDXL.
- ComfyUI workflow.
- LoRA.
- ControlNet.
Nhưng khác với LLM, image generation phụ thuộc GPU/VRAM theo cách riêng.
Một card 16GB VRAM thường đem lại nhiều dư địa hơn cho workflow ảnh lớn so với card 8GB, dù mức cần thiết vẫn phụ thuộc model và độ phân giải.
Local AI có cập nhật kiến thức Internet không?
Không tự động.
Một model local thông thường chỉ biết những gì được học trong quá trình training và những gì bạn cung cấp trong prompt/context.
Muốn dữ liệu mới, cần thêm:
- Web search.
- RAG.
- API dữ liệu.
- Database.
- Document ingestion.
Nếu bật web search cloud, hệ thống khi đó không còn hoàn toàn offline.
Local AI có tốt hơn ChatGPT không?
Đây là hai khái niệm khác nhau.
“Local AI” mô tả cách và nơi model chạy.
ChatGPT là một sản phẩm AI cloud với model, công cụ và dịch vụ riêng.
Một model 7B chạy local không nên được so trực tiếp với một frontier model trên cloud mà không xét:
- Kích thước model.
- Reasoning.
- Context.
- Tool use.
- Web access.
- Hardware.
7 sai lầm khi bắt đầu với Local AI
Checklist trước khi build PC Local AI
- ✓ Model dự kiến là 7B, 14B, 32B hay lớn hơn?
- ✓ Quantization nào?
- ✓ Cần context bao nhiêu?
- ✓ Muốn chạy CPU hay GPU?
- ✓ GPU cần bao nhiêu VRAM?
- ✓ RAM hệ thống đủ không?
- ✓ SSD còn bao nhiêu dung lượng?
- ✓ Có cần chạy offline hoàn toàn không?
- ✓ Có cần nhiều người dùng đồng thời không?
- ✓ Cloud AI có kinh tế hơn việc mua GPU hay không?
Nên chọn AI Online hay Local AI?
Câu hỏi thường gặp
Local AI có cần Internet không?
Không nhất thiết. Nếu model và runtime đã được tải về, một hệ thống local-only có thể inference hoàn toàn trên thiết bị. Các tính năng như web search hoặc cloud model vẫn cần Internet.
Ollama có gửi prompt lên Internet không?
Theo tài liệu hiện tại của Ollama, khi chạy model local, Ollama không nhìn thấy prompt hoặc dữ liệu của người dùng. Ollama cũng hỗ trợ local-only mode để tắt cloud features.
Local AI cần bao nhiêu RAM?
Không có một mức cố định. 16GB có thể chạy model nhỏ, 32GB thuận tiện hơn cho 7B–14B, 64GB phù hợp hơn khi tiến tới 32B. Model lớn và context dài cần nhiều memory hơn.
Không có card màn hình có chạy Local AI được không?
Có. Nhiều LLM có thể inference bằng CPU và RAM, nhưng tốc độ thường thấp hơn khi sử dụng GPU phù hợp.
Local AI có miễn phí hoàn toàn không?
Không nên hiểu như vậy. Model open-weight có thể không tính phí token, nhưng vẫn có chi phí phần cứng, điện năng, ổ cứng và quản trị hệ thống. Một số model cũng có điều khoản giấy phép riêng.
Local AI có an toàn hơn Cloud AI không?
Local AI có lợi thế khi dữ liệu không phải rời khỏi thiết bị, nhưng người dùng phải tự bảo vệ máy, API local, ổ cứng, tài khoản và model. Cloud có mô hình bảo mật khác và chính sách dữ liệu phụ thuộc nhà cung cấp.
Có nên dùng cả Local AI và Online AI không?
Có. Hybrid AI thường rất thực dụng: dùng local cho dữ liệu nhạy cảm và tác vụ đơn giản, sau đó sử dụng cloud khi cần frontier model, web research hoặc khả năng tính toán lớn hơn.
Trước khi chọn CPU hoặc VGA, hãy xác định model muốn chạy, quantization, context, số người sử dụng và tốc độ mong muốn. Một PC chạy 7B–14B có yêu cầu phần cứng rất khác một workstation dành cho 32B–70B, Stable Diffusion hoặc nhiều model chạy đồng thời.
BEZON – Máy Tính BMT
Hotline/Zalo: 0922.47.6789
126–128 Nguyễn Chí Thanh, P. Tân An, TP. Buôn Ma Thuột, Đắk Lắk
