Phan Đông GiangPhan Đông Giang
Tất cả bài viết
2026-07-078 phút

8 Cách Miễn Phí Để Trải Nghiệm GLM-5.2

Zhipu bất ngờ ra mắt GLM-5.2 mã nguồn mở theo giấy phép MIT — mô hình mạnh nhất từng có trong giới mã nguồn mở. Tổng hợp 8 cách dùng thử miễn phí, kèm benchmark và hướng dẫn chuyển đổi Claude Code.

8 Cách Miễn Phí Để Trải Nghiệm GLM-5.2

Vào sáng sớm ngày 17/6, Zhipu âm thầm thả một quả bom — GLM-5.2 chính thức ra mắt, mã nguồn mở theo giấy phép MIT.

Không rầm rộ quảng bá trước, không livestream họp báo. Nhưng ngay khi tin tức lan ra: lên trang chủ Hacker News, một bài tweet đạt 900K lượt xem, được chính Elon Musk thả tim, Hugging Face đứng ra tài trợ 6 tiếng compute miễn phí...

Điều gì khiến "quái vật" 753 tỷ tham số này khiến cả giới AI dậy sóng? Tôi đã dành trọn một ngày đào sâu mọi tài liệu công khai và tổng hợp lại bài phân tích chi tiết này.

GLM-5.2 Chính Xác Là Gì?

Nói gọn trong một câu: Mô hình mã nguồn mở mạnh nhất từ trước đến nay, với năng lực lập trình tiệm cận Claude Opus 4.8.

  • Kiến trúc: GLM MoE DSA, 753 tỷ tham số tổng, 40 tỷ tham số kích hoạt
  • Cửa sổ ngữ cảnh: 1M token (1 triệu token, dùng được toàn bộ)
  • Giấy phép: MIT (không giới hạn khu vực, cho phép dùng thương mại, được phép fork)
  • Tải trọng số: HuggingFace (zai-org/GLM-5.2), ModelScope
  • Phiên bản lượng tử hóa FP8: zai-org/GLM-5.2-FP8 (giảm yêu cầu bộ nhớ khi triển khai)

1 triệu token là bao nhiêu? Tương đương khoảng 750.000 chữ Hán, hoặc trọn vẹn một code repository cỡ trung. Bạn có thể nạp toàn bộ code của một dự án cùng lúc, để mô hình phân tích phụ thuộc chéo giữa các file, refactor toàn diện và debug các lỗi phức tạp.

Kết Quả Benchmark: Bước Nhảy Vọt Lịch Sử Cho Mô Hình Mã Nguồn Mở

Tôi đã tổng hợp lại các số liệu benchmark quan trọng:

Biểu đồ so sánh điểm FrontierSWE giữa GLM-5.2, Claude Opus 4.8, GPT-5.5 và GLM-5.1
FrontierSWE: Mã nguồn mở vs Mã nguồn đóng
  • Design Arena: Elo 1360, #1 toàn cầu. Vượt qua Claude Fable 5 từng thống trị trước đó (đã bị gỡ do lệnh kiểm soát xuất khẩu). Dẫn đầu ở mọi mảng con: thương hiệu marketing, thiết kế tham chiếu, phân tích dữ liệu, hàng tiêu dùng, gaming, mô phỏng.
  • Code Arena Frontend Leaderboard: #2 toàn cầu, chỉ sau Fable 5, nhưng vượt Claude Opus 4.7 Thinking tới 29 điểm. Đây là kiểm thử mù (blind test) với hàng triệu người dùng thật — không phải benchmark chạy theo bảng xếp hạng.
  • Agent Arena: #1 trong nhóm mô hình mã nguồn mở. Ngang ngửa Claude Opus 4.8 (chế độ không suy luận).
  • FrontierSWE: 74.4 điểm, chỉ kém Claude Opus 4.8 (75.1 điểm) đúng 0.7 điểm, vượt qua GPT-5.5 (72.6 điểm). Khoảng cách giữa mã nguồn mở và mã nguồn đóng đã thu hẹp từ "cách biệt cả thế hệ" xuống còn "chênh lệch không đáng kể".
  • Terminal-Bench 2.1: 81.0 điểm, trong khi Claude Opus 4.8 đạt 85.0, còn Gemini 3.1 Pro bị bỏ xa phía sau.
  • SWE-bench Pro: 62.1 điểm, cao nhất trong nhóm mã nguồn mở, vượt xa đàn anh GLM-5.1 (58.4 điểm).

3 Cột Mốc "Đầu Tiên" Trong Lịch Sử

  • Lần đầu tiên một mô hình mã nguồn mở đạt #1 toàn cầu trên Code Arena — bài kiểm thử mù với hàng triệu người dùng. Đây không phải benchmark kiểu "thi cử" như MMLU, mà là kiểm thử mù thực tế do người dùng thật thực hiện.
  • Lần đầu tiên một mô hình mã nguồn mở tiệm cận trong vòng 1% so với mô hình mã nguồn đóng tốt nhất trên FrontierSWE. Trước đây khoảng cách này bắt đầu từ 10 điểm; giờ chỉ còn 0.7 điểm.
  • Lần đầu tiên một mô hình Trung Quốc đạt khả năng tương thích Day 0 với phần cứng compute Trung Quốc. Ngay ngày ra mắt, mô hình đã chạy được trên 8 nền tảng compute nội địa: Huawei Ascend, T-Head, Moore Threads, Cambricon, Kunlunxin, Muxi, Haiguang, Biren. Không phải lời hứa trên slide, mà sẵn sàng ngay từ ngày đầu.

Vì Sao GLM-5.2 Xuất Hiện Đúng Thời Điểm Nhạy Cảm Nhất

Câu chuyện này bắt đầu bằng một chuỗi thời gian đầy kịch tính.

  • Ngày 12/6: Anthropic nhận chỉ thị kiểm soát xuất khẩu từ Bộ Thương mại Hoa Kỳ, buộc phải rút hai mô hình Claude Fable 5 và Mythos 5. Theo Fortune và Semafor, nguyên nhân bắt nguồn từ một phát hiện bảo mật kiểu jailbreak do Amazon báo cáo, được đẩy lên tới cấp Bộ trưởng Tài chính.
  • Ngày 13/6: Ngay trong ngày tin tức trên được công bố, Zhipu tung ra GLM-5.2. Giáo sư Tang Jie từ Đại học Thanh Hoa đăng trên X: "GLM-5.2 Hoàn Toàn Mở, Trí Tuệ Tiên Phong Thuộc Về Tất Cả Mọi Người" — đạt 898K lượt xem trong 36 giờ, lên thẳng trang chủ Hacker News.
  • Ngày 19/6: Hugging Face thông báo sẽ tài trợ 6 tiếng compute miễn phí toàn cầu cho GLM-5.2 — lần đầu tiên HF mở "kênh VIP độc quyền" này cho một mô hình Trung Quốc. Elon Musk đã thả tim bài đăng.

Một bên siết chặt, một bên mở toang. Dù là trùng hợp hay được sắp đặt kỹ lưỡng, hiệu ứng tạo ra là không thể phủ nhận.

Đây Là Chìa Khóa: 8 Cách Dùng GLM-5.2 Miễn Phí

Tôi đã dành khá nhiều thời gian để xác minh toàn bộ các kênh hiện có để sử dụng GLM-5.2, từ chính thức đến bên thứ ba, từ nội địa đến quốc tế — tổng cộng 8 cách.

Danh sách 8 cách truy cập GLM-5.2 miễn phí
8 cách truy cập GLM-5.2 miễn phí

Cách 1: Z.ai ZCode (Miễn phí 5 ngày cho người dùng mới)

Nền tảng Z.ai của Zhipu dành cho người dùng quốc tế tặng người dùng mới 3 triệu token GLM-5.2 miễn phí mỗi ngày, liên tục trong 5 ngày.

Tính năng "sát thủ" của nó: hỗ trợ thay thế trực tiếp cho Claude Code. Trong file ~/.claude/settings.json, chỉ cần trỏ base_url về https://api.z.ai/api/anthropic, đặt model thành glm-5.2, là người dùng Claude Code có thể chuyển đổi liền mạch.

CLAUDE.md, project memory, slash command, subagent của bạn đều giữ nguyên. Giao diện vẫn hiển thị nhãn "Sonnet"/"Opus", nhưng các yêu cầu thực tế được định tuyến sang GLM-5.2.

Lưu ý: Hạn mức miễn phí chỉ áp dụng cho các lệnh gọi trong client ZCode; API bên ngoài không dùng chung hạn mức này. Sau 5 ngày, bạn cần đăng ký gói Coding Plan hoặc nạp thêm.

🔗 Website: https://z.ai

Cách 2: SiliconFlow (Tặng 14 tệ khi đăng ký)

Một trong những nền tảng API bên thứ ba tiện lợi nhất tại Trung Quốc. Người dùng mới nhận 14 tệ tín dụng, đủ dùng khoảng 20 triệu token.

Giá GLM-5.2: 8 tệ/triệu token đầu vào, 28 tệ/triệu token đầu ra. Hỗ trợ nạp tiền qua WeChat/Alipay, độ trễ thấp trên máy chủ nội địa (thường dưới 100ms), định dạng tương thích OpenAI.

🔗 Website: https://siliconflow.cn 🔗 Trang mô hình: https://siliconflow.cn/models/zai-org/GLM-5.2

Cách 3: NVIDIA NIM

Đăng ký tại build.nvidia.com, tạo API Key (đặt thời hạn "Never"), và gọi bằng model ID z-ai/glm5.

Một key dạng nvapi-xxx có thể gọi mọi mô hình miễn phí trên NIM, hạn mức miễn phí 40 RPM, không cần xác minh thẻ tín dụng. Dùng được toàn cầu, phù hợp với lập trình viên quốc tế.

🔗 Nền tảng NIM: https://build.nvidia.com 🔗 Trang GLM-5.2: https://build.nvidia.com/z-ai/glm5 (cần đăng nhập)

Cách 4: Mạng Siêu Tính Toán Quốc Gia (SCNet)

GLM-5.2 lên sóng ngay trong ngày được mã nguồn mở. Vào mục "Chat" hoặc "Model API" để gọi trực tiếp chỉ với một cú click, không cần thiết lập môi trường phức tạp.

Doanh nghiệp và lập trình viên cũng có thể tải file mô hình trong "Thư viện Mô hình" của cộng đồng AI, tận dụng môi trường phát triển Notebook của nền tảng để triển khai, fine-tune và tối ưu trọn gói.

🔗 Website: https://www.scnet.cn

Cách 5: JD Cloud JoyBuilder

Nền tảng phát triển mô hình JoyBuilder của JD Cloud đã tích hợp GLM-5.2 ngay lập tức. Kết hợp framework suy luận tự phát triển của JD Cloud cùng các kỹ thuật như tách PD, cache KV Cache và speculative sampling, throughput và hiệu suất phản hồi được tối ưu thêm.

Phù hợp với các đội nhóm cần dịch vụ ổn định cấp doanh nghiệp.

Cách 6: Nền Tảng Điện Toán Thông Minh E-Surfing Của China Telecom (Xirang)

Sự kết hợp "cloud quốc gia + mô hình quốc gia". GLM-5.2 được triển khai trên nền tảng điện toán thông minh tích hợp E-Surfing Xirang của China Telecom ngay ngày hôm sau khi ra mắt. Model hub của nền tảng này đã có sẵn các mô hình chủ lực như DeepSeek, Qwen và GLM, hỗ trợ gọi API thống nhất chỉ với một cú click.

🔗 China Telecom Xirang TokenHub: https://ctxirang.ctyun.cn/maas/home

Cách 7: Cộng Đồng ModelScope

Cộng đồng ModelScope của Alibaba DAMO Academy cũng đồng thời lưu trữ trọng số mô hình GLM-5.2 để tải về và triển khai miễn phí. Tốc độ truy cập từ Trung Quốc đại lục nhanh hơn so với Hugging Face.

Phù hợp với các đội nhóm cần triển khai cục bộ, sẵn sàng phục vụ suy luận bằng framework vLLM hoặc SGLang.

🔗 ModelScope: https://modelscope.cn 🔗 Trang mô hình GLM-5.2: https://modelscope.cn/models/ZhipuAI/GLM-5.2 (khuyến nghị cho người dùng nội địa)

Cách 8: Tải Trọng Số Từ HuggingFace Và Tự Triển Khai

Trọng số GLM-5.2 được công bố trên HuggingFace, và repo GitHub cung cấp mã nguồn cùng tài liệu triển khai. Giấy phép MIT cho phép bạn:

  • Sử dụng thương mại, chỉnh sửa, phân phối lại
  • Fine-tune LoRA trên codebase riêng của bạn
  • Fork và duy trì nhánh riêng của mình

🔗 Trọng số HuggingFace: https://huggingface.co/zai-org/GLM-5.2 🔗 Mã nguồn GitHub: https://github.com/zai-org/GLM-5 🔗 Phiên bản lượng tử hóa FP8: https://huggingface.co/zai-org/GLM-5.2-FP8

Triển khai (cần cấu hình 8×H100 hoặc tương đương):

Sao chép code
# Triển khai với vLLM (khuyến nghị cho production)
pip install vllm
vllm serve "zai-org/GLM-5.2"

# Triển khai với SGLang
pip install sglang
python3 -m sglang.launch_server \
  --model-path "zai-org/GLM-5.2" \
  --host 0.0.0.0 --port 30000

# Khởi chạy nhanh với Docker
docker model run hf.co/zai-org/GLM-5.2

Với lập trình viên cá nhân, nên ưu tiên dùng API — một mô hình 753B triển khai cục bộ ở FP16 cần khoảng 1.5TB VRAM.

Chuyển Đổi Claude Code Chỉ Với 1 Cú Nhấp — Trải Nghiệm Thực Tế

Đây là tính năng khiến tôi hào hứng nhất. Z.ai đã ra mắt tính năng thay thế trực tiếp cho Claude Code ngay ngày phát hành, và chỉ cần một biến môi trường là chuyển đổi xong:

Sao chép code
export ANTHROPIC_BASE_URL="https://api.z.ai/api/anthropic"
export ANTHROPIC_AUTH_TOKEN="$ZAI_API_KEY"
export ANTHROPIC_MODEL="glm-5.2[1m]"
export API_TIMEOUT_MS="3000000"

Để chuyển về lại, chỉ cần unset các biến này và khởi động lại Claude Code.

  • Điều không đổi: CLAUDE.md, slash command, subagent, project memory
  • Điều thay đổi: Thinking preset chỉ còn High và Max (không có auto); độ trễ token đầu tiên với ngữ cảnh 1M là 30-90 giây (Claude tương đương khoảng 5-15 giây); hạn mức tính theo gói Coding Plan của Z.ai

GLM-5.2 Có Phù Hợp Với Bạn Không?

Phù hợp nếu bạn:

  • Thường xuyên gặp giới hạn ngữ cảnh khi refactor nhiều file (1M token đủ dùng cho hầu hết monorepo)
  • Cần đáp ứng yêu cầu tuân thủ về trọng số mô hình mã nguồn mở, có thể kiểm toán
  • Làm các tác vụ lập trình frontend và thiết kế (thế mạnh lớn nhất của GLM-5.2)
  • Muốn phòng ngừa rủi ro phụ thuộc vào một nhà cung cấp mô hình duy nhất

Ít phù hợp nếu bạn:

  • Cần benchmark công khai đầy đủ trước khi bàn giao (một số điểm benchmark vẫn đang chờ cập nhật)
  • Làm lập trình tổng quát và suy luận phức tạp (Opus 4.8 vẫn có lợi thế)
  • Yêu cầu độ trễ cực thấp (token đầu tiên với ngữ cảnh 1M mất 30-90 giây)

Lời khuyên của tôi: Hãy tận dụng các hạn mức miễn phí. Dùng 14 tệ của SiliconFlow và 5 ngày miễn phí của Z.ai. Người dùng Claude Code có thể chuyển đổi trực tiếp trong một tuần — trải nghiệm thực tế luôn đáng tin hơn benchmark.

Lời Kết

Việc ra mắt GLM-5.2 không đơn thuần là một bản cập nhật mô hình. Nó xuất hiện chỉ 5 ngày sau khi Anthropic buộc phải rút Fable 5, được mã nguồn mở theo giấy phép MIT, cùng tuyên bố của Giáo sư Tang Jie "Trí Tuệ Tiên Phong Thuộc Về Tất Cả Mọi Người" — mã nguồn mở như một hình thức "bình đẳng hóa công nghệ" không còn là khẩu hiệu trừu tượng nữa.

Hugging Face đứng ra trả chi phí compute, Elon Musk thả tim, tương thích Day 0 với phần cứng compute Trung Quốc — sự kết hợp này gần như không thể tái hiện.

Liệu GLM-5.2 có thực sự thay thế được Claude Opus 4.8? Đừng hỏi benchmark. Hãy tự hỏi chính mình sau một tuần sử dụng thực tế.