Rủi ro LLM: Điều ẩn sau ô chat

Mô hình ngôn ngữ lớn rất mạnh, nhưng không mặc nhiên miễn phí, trung lập hay vô hại. Một câu lệnh đơn giản có thể che khuất bốn vấn đề: hạ tầng đắt đỏ, nhu cầu điện và làm mát, rủi ro riêng tư và bảo mật, cùng khả năng tạo câu trả lời sai nhưng nghe rất chắc chắn. Trang này giúp bạn nhìn thấy quy trình phía sau: huấn luyện tạo nên mô hình, suy luận xử lý từng yêu cầu, còn sử dụng có trách nhiệm nghĩa là kiểm tra chi phí, dữ liệu, độ chính xác và mức phụ thuộc.

Chi phí huấn luyện Xây dựng mô hình quy mô tiên tiến có thể cần hàng triệu giờ GPU trước khi người dùng gửi câu lệnh đầu tiên.
Chi phí suy luận Mỗi yêu cầu trò chuyện, tóm tắt hoặc viết mã đều dùng phần cứng, bộ nhớ, mạng và điện.
Rủi ro thông tin Dữ liệu riêng tư, kết quả thiên lệch, thông tin bịa đặt và sự tin tưởng quá mức có thể gây hại thật.
Thực hành tốt Dùng LLM khi có giá trị, kiểm tra kết quả quan trọng và tránh gọi lại không cần thiết.
Người dùng chỉ thấy một ô chat gọn gàng, không thấy các bản sao mô hình, chip tăng tốc, bộ nhớ, mạng, điện lưới, làm mát, dự phòng, hệ thống an toàn và công việc kỹ thuật phía sau mỗi câu trả lời. Giá thuê bao không cho thấy toàn bộ hạ tầng vật lý này.
Các tầng mô hình và giá API OpenAI được đối chiếu với tài liệu chính thức ngày 03/08/2026. Số liệu ước tính và phép tính suy ra đều được ghi rõ.

1. Chi phí vật lý

LLM trông giống phần mềm, nhưng chạy trên hạ tầng vật lý gồm GPU, bộ nhớ, lưu trữ, điện, làm mát và mạng. Các ví dụ sau cho thấy quy mô đó.

Công suất của một GPU cao cấp

Nguồn chính thức
700 W

NVIDIA công bố H100 SXM có TDP tối đa 700 W và bộ nhớ 80 GB. Một máy chủ 8 GPU đã cần tới 5,6 kW riêng cho GPU, chưa tính CPU, mạng, lưu trữ và làm mát.

Quy mô huấn luyện

Thẻ mô hình
30.84M H100 GPU-hours

Meta cho biết Llama 3.1 405B dùng 30,84 triệu giờ GPU H100 để huấn luyện với hơn 15 nghìn tỷ token. Đây là tính toán quy mô công nghiệp, không phải quy mô máy tính cá nhân.

Nước làm mát

Nghiên cứu
700,000 L direct
5.4M L total

Một nghiên cứu năm 2023 ước tính việc huấn luyện GPT‑3 tại các trung tâm dữ liệu Microsoft ở Mỹ có thể dùng trực tiếp 700.000 lít nước sạch và tổng cộng khoảng 5,4 triệu lít nếu tính cả nước gián tiếp.

Lưu trữ mô hình

Suy ra
~810 GB weights

Mô hình 405 tỷ tham số lưu ở FP16 cần khoảng 810 GB chỉ cho trọng số. Bản sao, checkpoint, trạng thái bộ tối ưu, KV cache và bản dự phòng làm nhu cầu thực tế cao hơn nhiều.

Đầu tư hạ tầng

IEA 2026
Hơn 10,6 triệu tỷ đồng
Năm 2025

IEA cho biết chi tiêu vốn của năm công ty công nghệ lớn vượt mức tương đương 10,6 triệu tỷ đồng trong năm 2025. Con số này rộng hơn chi phí huấn luyện một mô hình và cho thấy quy mô hạ tầng phía sau dịch vụ AI.

Suy luận có thể chiếm phần lớn

HotCarbon
25x training emissions

Trong một kịch bản lưu lượng cao, Chien và cộng sự ước tính việc phục vụ hệ thống giống ChatGPT có thể cần số giờ GPU gấp khoảng 25 lần một lần huấn luyện GPT‑3. Đây là ước tính kịch bản, không phải phép đo dịch vụ hiện nay.

Điểm chính: giao diện đơn giản nhưng hệ thống phía sau rất lớn. Ô nhập gọn gàng không làm chi phí biến mất.

2. Chi phí sử dụng hằng ngày

Huấn luyện tốn kém, nhưng suy luận lặp lại mới tạo ra hóa đơn thường xuyên. Hãy thay đổi các con số để xem tác động.

Giá API quy đổi cho mỗi triệu token đầu vào/đầu ra, tham khảo ngày 03/08/2026: Luna 5.300₫/31.800₫; Terra 53.000₫/318.000₫; Sol 132.500₫/795.000₫. Giá và tỷ giá có thể thay đổi.

100,000

Các mức: 1 nghìn, 10 nghìn, 100 nghìn, 1 triệu và 10 triệu yêu cầu mỗi ngày.

Ví dụ mặc định: câu lệnh tương đối chi tiết hoặc một lượt trò chuyện ngắn.

Ví dụ mặc định: câu trả lời ngắn gọn, không phải báo cáo dài.

Chi phí API ước tính mỗi ngày
0₫
Chi phí API ước tính mỗi tháng
0₫
Chi phí API ước tính mỗi năm
0₫
Token mỗi ngày
0

Ý nghĩa ba tầng và những gì vẫn bị ẩn

  • Luna: Tầng tiết kiệm cho tác vụ hiệu quả, lưu lượng cao.
  • Terra: Tầng trung gian cân bằng năng lực và chi phí.
  • Sol: Tầng cao nhất cho suy luận chuyên môn và lập trình phức tạp.
  • Với cùng lượng token, giá đầu vào và đầu ra của Sol cao gấp 25 lần Luna. Mức suy luận cao, chế độ Pro, ngữ cảnh dài, gọi công cụ, hình ảnh và nhiều bước agent có thể làm tăng công việc, độ trễ và token tính phí.
  • Thông tin chưa công bố: OpenAI không công bố số tham số, số chip tăng tốc, điện hoặc nước làm mát cho từng câu lệnh, hay toàn bộ chi phí hạ tầng của các tầng này. Không nên suy diễn các con số đó chỉ từ giá API.

Cách đọc các thanh: hóa đơn dùng giá token chính thức. Thanh hạ tầng và rủi ro vận hành chỉ minh họa áp lực tải, không phải số đo điện năng hay tỷ lệ rủi ro khoa học, vì chưa có đủ dữ liệu công khai theo từng yêu cầu.

Hóa đơn suy luận nhìn thấy 0%
Áp lực hạ tầng minh họa 0%
Áp lực phụ thuộc/vận hành minh họa 0%
Lưu lượng vừa phải đã tạo ra hóa đơn định kỳ. Chi phí API chỉ là phần nhìn thấy; phía dưới còn có điện, làm mát, lưu trữ và năng lực phục vụ.

3. Vì sao rủi ro khó nhìn thấy

Điều người dùng nhìn thấy

  • Một ô chat và câu trả lời nhanh.
  • Giá thuê bao hoặc giá token đơn giản.
  • Không nhìn thấy cụm GPU hay hệ thống làm mát.
  • Không thấy rõ bản sao lưu trữ, checkpoint hay lưu lượng tăng đột biến.

Những gì nằm phía dưới

  • Phần cứng tăng tốc cao cấp tiêu thụ nhiều điện.
  • Nước làm mát or equivalent cooling infrastructure.
  • Trọng số, bộ nhớ đệm, checkpoint và bản sao mô hình lớn.
  • Lưu lượng suy luận lặp lại có thể vượt tác động của một lần huấn luyện theo thời gian.

Điểm cần nhớ

  • Huấn luyện tốn kém, nhưng suy luận lặp lại ở quy mô lớn có thể còn tốn kém hơn theo thời gian.
  • Điện và nước quan trọng vì hạ tầng LLM là vật lý, không phải phép màu.
  • Kích thước mô hình ảnh hưởng không chỉ chất lượng mà còn bộ nhớ, lưu trữ, làm mát và chi phí.
  • Thực hành tốt: dùng LLM cho việc có giá trị cao rồi tái sử dụng kết quả cục bộ khi có thể.

4. Sử dụng LLM có chủ đích

Quy trình tốt không phải là “không bao giờ dùng AI”, mà là dùng đúng chỗ, bảo vệ dữ liệu nhạy cảm, kiểm tra thông tin quan trọng và kiểm soát chi phí lặp lại.

Kiểm tra dữ liệu

Không nhập dữ liệu riêng tư, bí mật, y tế, tài chính, pháp lý hoặc thông tin nhận diện học sinh nếu hệ thống chưa được phê duyệt cho mục đích đó.

Kiểm tra câu trả lời

LLM có thể nói rất chắc chắn khi sai. Hãy kiểm tra dữ kiện, nguồn trích dẫn, phép tính và mã trước khi sử dụng.

Kiểm tra thiên lệch

Dữ liệu huấn luyện có thể chứa định kiến hoặc thiếu sót. Hãy xem lại giả định thiếu công bằng, góc nhìn bị bỏ quên và bối cảnh văn hóa.

Kiểm tra chi phí

Câu lệnh lặp lại, ngữ cảnh dài và câu trả lời dài làm tăng token. Hãy lưu đệm, tái sử dụng, tóm tắt và xử lý theo lô khi phù hợp.

Kiểm tra sự phụ thuộc

Nếu quy trình chỉ hoạt động với một nhà cung cấp hoặc một mô hình lớn, bạn có nguy cơ bị phụ thuộc. Hãy giữ bản xuất, phương án dự phòng và kiến thức của con người.

Kiểm tra giá trị

Dùng mô hình nhỏ nhất vẫn đáp ứng yêu cầu và câu lệnh ngắn nhất vẫn đủ rõ. Câu lệnh dài nhất không phải lúc nào cũng tốt nhất.

Nguồn và ghi chú

  • Thông số NVIDIA H100: TDP tối đa 700 W và bộ nhớ 80 GB. nvidia.com
  • Thẻ mô hình Llama 3.1 của Meta: mô hình 405B dùng 30,84 triệu giờ GPU H100; cả họ mô hình dùng 39,3 triệu giờ GPU. Thẻ mô hình Meta Llama
  • IEA, 2026: điện năng trung tâm dữ liệu tăng 17% trong năm 2025; riêng trung tâm tập trung vào AI tăng 50%. Điện năng toàn ngành được dự báo tăng từ 485 TWh năm 2025 lên khoảng 950 TWh năm 2030. Tóm tắt IEA
  • Li và cộng sự, 2023, “Making AI Less Thirsty”: ước tính huấn luyện GPT‑3 dùng trực tiếp 700.000 lít nước và tổng dấu chân nước khoảng 5,4 triệu lít. arxiv.org
  • Chien và cộng sự, HotCarbon 2023: trong một kịch bản lưu lượng cao giống ChatGPT, số giờ GPU suy luận hằng năm được ước tính gấp khoảng 25 lần số giờ GPU dùng để huấn luyện GPT‑3 một lần. Đây không phải phép đo dịch vụ hiện tại. Bài báo HotCarbon
  • Giá OpenAI quy đổi ngày 03/08/2026 theo tỷ giá 1 USD ≈ 26.500₫, cho mỗi triệu token đầu vào/đầu ra: GPT‑5.6 Sol 132.500₫/795.000₫, Terra 53.000₫/318.000₫ và Luna 5.300₫/31.800₫. Bảng giá OpenAI
  • Ước tính suy ra: 21,6 GWh cho GPU khi huấn luyện Llama 3.1 405B được tính từ 30,84 triệu giờ GPU × 0,7 kW; 810 GB lưu trữ được tính từ 405 tỷ tham số × 2 byte ở FP16.
  • Không ước tính số tham số của các mô hình OpenAI độc quyền vì thông tin này chưa được công bố. Giá API không phải thước đo đáng tin cậy cho kích thước mô hình hoặc điện năng mỗi yêu cầu.