Chọn model AI với khung... Vỏ, Não, Ví
Trong quá trình nói chuyện với các thành viên weOPC (cộng đồng xây công ty 1 người với AI), câu hỏi mà tôi thấy các bạn đặt lại nhiều lần đó là:
"Tôi đã dùng Hermes, OpenClaw rồi, sao vẫn bị trừ phí API?"
Lần đầu tôi giải thích, xong sau đó lần thứ hai tôi vẫn phải giải thích lại, dài hơn. Đến lần thứ ba thì tôi hiểu ra vấn đề không nằm ở chỗ tôi giải thích chưa đủ rõ mà là người hỏi đang gộp ba thứ hoàn toàn khác nhau vào làm một:
Hermes, OpenClaw, GoClaw, Claude Code. Claude, ChatGPT, Gemini. Llama, Qwen, Gemma.
Với phần lớn người tôi gặp, cả 9 cái tên đó đều là "AI". Nên khi tiền bị trừ ở một chỗ mà họ tưởng đã trả xong ở chỗ khác, chẳng ai hiểu chuyện gì đang xảy ra.
Tôi nhận ra phần lớn người dùng AI hiện nay chưa phân biệt được các mô hình AI chạy trên cloud (chạy trên đám mây) & mô hình chạy trên local (chạy máy cục bộ). Cuối tôi nghĩ ra cách gom lại thành ba câu hỏi tôi gọi là khung:
Vỏ - Não - Ví
Hãy dùng 3 câu hỏi này
Với bất kỳ công cụ AI nào, hỏi ba câu này là ra hết.
Vỏ nào đang điều khiển? Hermes, OpenClaw, GoClaw, Claude Code, hay cái app bạn tự làm. Vỏ là phần mềm ra lệnh: nó nhớ mục tiêu, chia việc, gọi công cụ, lặp lại cho tới khi xong. Nó không tự sinh ra câu trả lời nào.
Não nào đang suy nghĩ? Claude, ChatGPT, Gemini chạy trên máy chủ nhà cung cấp. Hoặc Llama, Qwen, Gemma chạy ngay trên máy tính của bạn.
Ví nào đang trả? Gói thuê tháng. Hoặc API tính theo lượng chữ. Hoặc tiền điện nhà bạn.
Câu quan trọng nhất nằm ở chỗ này: vỏ không suy nghĩ. Cái nào suy nghĩ thì cái đó tính tiền.
Hermes, OpenClaw là vỏ. Bạn giao việc, nó chia nhỏ ra rồi gửi từng phần tới một cái não. Nếu não đó là Claude nằm trên máy chủ Anthropic, mỗi lượt suy nghĩ là một lần gọi API có hóa đơn. Hermes, OpenClaw chỉ đứng ra lệnh.
Phân biệt nhanh AI Cloud & AI Local:
AI Cloud (trên mây) và AI Local (trên máy cá nhân) khác nhau ở nơi xử lý dữ liệu. AI Cloud dùng siêu máy tính của hãng công nghệ qua mạng Internet, rất thông minh nhưng cần mạng. AI Local tự chạy trực tiếp trên thiết bị của bạn, riêng tư, chạy nhanh không cần mạng nhưng kém thông minh hơn.
AI Cloud (Trí tuệ nhân tạo trên mây)
Cách hoạt động: Dữ liệu chạy từ máy bạn lên máy chủ khổng lồ của hãng (như Google, OpenAI).
Ưu điểm: Rất thông minh, hiểu biết rộng, xử lý được việc nặng.
Nhược điểm: Cần có mạng Internet mới dùng được; lộ dữ liệu riêng tư cho bên thứ ba.
Ví dụ đời thường: Bạn gọi tổng đài viên siêu giỏi ở trụ sở chính qua điện thoại; họ biết mọi thứ nhưng phải có sóng điện thoại mới nghe gọi được. Giống như bạn dùng ChatGPT hay Google Gemini.
AI Local (Trí tuệ nhân tạo trên thiết bị)
Cách hoạt động: Dữ liệu được xử lý ngay trong chip điện thoại hoặc máy tính của bạn.
Ưu điểm: Bảo mật tuyệt đối 100%; dùng được ngay cả khi mất mạng; phản hồi tức thì.
Nhược điểm: Tốn pin, tốn bộ nhớ và không thông minh bằng AI Cloud.
Ví dụ đời thường: Bạn có một trợ lý riêng ngồi ngay cạnh bàn làm việc. Người này chỉ biết những gì bạn kể, không cần điện thoại hay Internet, nhưng không giỏi bằng tổng đài lớn. Giống như tính năng tự động sửa lỗi gõ phím hay mở khóa khuôn mặt (FaceID) trên điện thoại.
Bốn tổ hợp hay gặp
Ba tầng đó ghép tự do với nhau. Và đó chính là chỗ gây rối. Ví dụ:
Hermes cộng não Claude trên cloud. Vẫn trả phí API. Đây là tổ hợp của người hay hỏi tôi. Vỏ miễn phí không có nghĩa là não miễn phí.
Hermes cộng não chạy local. Không mất đồng phí API nào. Đổi lại máy phải khỏe, và câu trả lời kém hơn rõ rệt.
Gói thuê tháng trên claude.ai hoặc chatgpt.com. Trả cố định, dùng nhiều hay ít cũng thế. Nhưng không có vỏ nào tự động làm việc thay bạn, phải ngồi gõ từng câu.
OPC HQ (Trụ sở công ty 1 người vận hành bởi tác nhân AI). Vỏ do tôi làm, não Claude, OpenAI, Gemini, DeepSeek, Kimi K3… trên cloud, ví của chính người dùng. Tôi sẽ nói kỹ hơn ở dưới.

Nhìn theo khung này thì câu hỏi ban đầu tự trả lời. Hermes là vỏ, não đang đặt ở cloud, nên mỗi lượt suy nghĩ phải trả cho cloud.
Ba con số của chính tôi
Tôi ghét đọc bài nói về chi phí AI mà không có số. Nên đây là số của chính tôi.
Bảng điều khiển OPC HQ tháng 7 năm 2026 báo: 677.814 chữ vào, 67.820 chữ ra, 8 lượt tìm kiếm web. Tổng 3,45 đô, khoảng 91.500 đồng theo tỷ giá bán Vietcombank ngày 28/7/2026 là 26.525 đồng một đô.
Nhưng hóa đơn AI cả tháng của tôi không phải 91.500 đồng. Là khoảng 2 triệu 100 nghìn đồng.
Tôi để ba con số cạnh nhau, vì chỗ chênh giữa chúng chính là bài học của cả bài này.
3,45 đô là tiền của một cái vỏ. OPC HQ chỉ là một trong mấy cái vỏ tôi chạy.
20 đô là tổng tiền API Anthropic cả tháng. Tức là tất cả các vỏ của tôi cộng lại: OPC HQ, Claude Code lúc tôi ngồi viết bài, bộ não thứ hai chạy trên Obsidian, mấy quy trình tự động khác. Tất cả cắm vào cùng một cái não, cùng rút từ một chỗ.
2,1 triệu, khoảng 79 đô, là cả cái ví. Gồm tiền API cộng các gói thuê tháng tôi trả đều đặn.
Ba con số đều đúng. Chúng đo ba thứ khác nhau. Và tôi (cũng như nhiều người khác) đã từng nhầm lẫn đúng chỗ này.
Bảng giá Anthropic cho mô hình Claude Opus 5 là 5 đô cho một triệu chữ vào (input) và 25 đô cho một triệu chữ ra (output). Tìm kiếm web tính riêng, 10 đô cho 1.000 lượt.
Vài tuần trước con số của OPC HQ không đẹp thế này. Có khách báo tốn 1,77 đô cho một việc. Gần 47.000 đồng cho một lần giao việc.
Tôi ngồi đào và tìm ra hai chỗ hở. Phần bối cảnh dài khoảng 10.000 chữ bị gửi lại nguyên vẹn mỗi lượt. Và chi phí tìm kiếm web không được đếm vào số hiển thị, nên nhìn màn hình thì rẻ mà hóa đơn thì không.
Bật bộ nhớ đệm cho khối bối cảnh xong, phần chữ vào lặp lại chỉ còn tính một phần mười giá. Chi phí mỗi việc giảm khoảng 37 tới 60 phần trăm tùy việc dài ngắn.
Tôi kể chuyện này vì nó cho thấy một điều. Khi bạn biết tiền đang chảy ở tầng nào, bạn sửa được. Còn khi ba tầng nhập thành một khối mờ, bạn chỉ biết mỗi câu "AI sao đắt thế".
Vậy nếu… chạy AI trên máy nhà thì sao?
Câu này rất đáng để viết chi tiết nè, vì đây là chỗ nhiều người hay hiểu nhầm & bị dụ theo cả hai hướng.
Thứ nhất, về máy móc: mức tối thiểu để chạy được một mô hình tử tế là 16 GB RAM cộng card đồ họa 6 GB trở lên, hoặc một máy Mac dùng chip Apple.
Card 8 GB chạy được mô hình cỡ 7 tới 9 tỉ tham số như Llama 3.1 8B hay Qwen3 8B. Muốn chạm cỡ 70 tỉ tham số, tức gần mức bạn thấy nó thông minh thật, cần 48 GB trở lên. Đó là tiền của một cái máy, không phải một cái card.
Thứ 2, về chất lượng: mô hình local năm 2026 đã đi rất xa, nhưng vẫn kém 10 tới 20 phần trăm so với các não cloud hàng đầu ở việc cần suy luận nhiều bước. Riêng viết mã thì khoảng cách hẹp lại đáng kể, có mô hình chỉ còn cách Claude Sonnet 5 khoảng 6 phần trăm. Với việc tóm tắt, dịch, hỏi đáp đơn giản thì local dùng ngang cloud, khỏi nghĩ nhiều.
Thứ 3, về điểm hòa vốn: tôi có đọc một tính toán cho thấy người tiêu 80 đô một tháng cho API cloud sẽ hoàn được tiền một card đồ họa chạy local trong khoảng 7 tháng, sau đó chạy gần như miễn phí nhiều năm.
Con số 80 đô này là chỗ tôi phải dừng lại lâu nhất khi viết bài này.
Vì nhìn thoáng qua thì tôi đang đứng ngay ngưỡng. Hóa đơn AI của tôi khoảng 79 đô một tháng. Theo phép tính kia, 7 tháng là hoàn vốn một cái card, rồi chạy gần như miễn phí nhiều năm sau.
Nhưng đó là tôi đang đọc sai tầng.
Ngưỡng 80 đô tính cho tiền API, vì cái card đồ họa chỉ thay được cái não trên cloud. Nó không thay được gói thuê tháng, không thay được mấy dịch vụ tôi trả riêng.
Tiền API của tôi là 20 đô. Bằng một phần tư ngưỡng.
Với mức đó, mua máy chạy local là quyết định tệ về tiền. Tôi sẽ bỏ ra mấy chục triệu để tiết kiệm khoảng 530 nghìn đồng mỗi tháng, và nhận lại câu trả lời kém hơn ở đúng việc tôi làm nhiều nhất.
Đây chính là lý do tôi cần ba câu hỏi kia. Nếu chỉ nhìn con số 79 đô, tôi đã đi mua máy rồi.
Local đáng làm khi bạn có một trong hai lý do thật đó là:
Khối lượng dùng lớn tới mức hóa đơn API thành gánh nặng.
Hoặc dữ liệu tuyệt đối không được ra khỏi máy.
Không có lý do nào trong hai cái trên thì bạn đang mua thêm sự phức tạp nếu chọn chạy các mô hình AI local
Khi xây dựng OPC HQ, vì sao tôi để khách tự mang chìa khóa?
BYOK viết đầy đủ là "bring your own key", mang chìa khóa của bạn tới.
Nghĩa là tôi làm cái vỏ, bạn tự lấy chìa khóa API riêng từ nhà cung cấp AI, và chi phí não bạn trả thẳng cho họ. Tôi không đứng giữa, không ăn chênh lệch, không thấy nội dung, công việc bạn làm.
Lúc đầu tôi tưởng đây là chỗ dễ hiểu nhất. Sai hoàn toàn. Đây là chỗ khó hiểu nhất, và nó khiến nhiều người nghĩ… tôi đang thu tiền của họ.
Vì trong đầu người mua, đã trả tiền cho một sản phẩm AI thì AI phải chạy. Nghe nói còn phải tự lấy chìa khóa và tự trả thêm một khoản nữa, phản ứng đầu tiên rất tự nhiên: vậy tôi trả tiền cho cái gì?
Nếu đọc bài này rồi tôi hy vọng bạn hiểu: bạn trả cho cái vỏ.
Cho phần biết chia việc, biết nhớ mục tiêu công ty của bạn, biết tự chạy tiếp mà không cần bạn ngồi gõ từng câu, biết tự xây dựng bộ não của công ty/ dự án & làm nó “dầy lên” qua quá trình làm việc . Cái não thì bạn thuê thẳng từ Anthropic, OpenAI, Google, Moonshot, DeepSeek… và bạn thấy đúng từng xu mình tiêu.
Ba câu hỏi này dùng được cho cả những thứ chưa ra đời
Điều tôi thích nhất ở khung Vỏ, Não, Ví là nó không cũ đi.
Sáu tháng nữa sẽ có thêm chục cái tên mới, nhiều mô hình AI mới ra đời. Sẽ có vỏ mới, não mới, và chắc chắn có người bán hàng nói với bạn rằng cái của họ khác hẳn.
Bạn chỉ cần hỏi ba câu cũ.
Vỏ nào đang điều khiển?
Não nào đang suy nghĩ?
Ví nào đang trả tiền?
Ba câu đó bóc được gần hết những lời quảng cáo mà bạn sẽ nghe.
Tôi vẫn nhớ cảm giác lần đầu nhìn hóa đơn API khi dùng AI và không hiểu vì sao nó ra con số đó. Cái cảm giác không kiểm soát được tiền của mình, dù số tiền chẳng lớn. Và 3 câu hỏi này ra đời từ đúng chỗ đó.
Vì thế sau này nếu ai gỏi bạn: “Tôi đã dùng Hermes, OpenClaw rồi, sao vẫn bị trừ phí API?”
Bạn chỉ cần trả lời: Hermes, OpenClaw là vỏ, não của bạn đang ở trên cloud, nên cloud tính tiền. Muốn khỏi trả thì đổi não, đừng đổi vỏ.
Hy vọng bạn thích bài viết này, tôi sẽ dừng ở đây.
Ngọc ở Chạm Station (tôi vừa mở công ty Chạm Station - công ty 1 người vận hành bởi tác nhân AI)




