Đánh giá DeepSeek V4: So sánh với các mô hình lớn nội địa khác

DeepSeek V4 - Ghi chú đánh giá và trải nghiệm thử nghiệm

Phụ lục: Thông tin môi trường kiểm tra mô hình

Nguồn mô hình kiểm tra

  1. DeepSeek V4 Pro — Sử dụng phiên bản chính thức của DeepSeek, bật chế độ "Suy nghĩ sâu sắc" và "Chế độ chuyên gia".
  2. DeepSeek V4 Flash — Truy cập qua API cục bộ.
  3. Qwen 3.5 Plus — Truy cập qua API cục bộ.
  4. GLM 5.1 — Truy cập qua API cục bộ và qua Trae (phiên bản nội địa).

Tất cả các cuộc gọi API cục bộ đều được thực hiện trong Claude Code.

I. Cấu hình môi trường

Chuyển đổi mô hình Claude Code sang DeepSeek V4

Trước tiên, theo hướng dẫn từ trang web chính thức, tôi đã chuyển đổi mô hình cục bộ của Claude Code sang DeepSeek V4.

Hướng dẫn chính thức: https://api-docs.deepseek.com/zh-cn/guides/coding_agents

Tôi đơn giản là để "con tôm nhỏ" của mình cấu hình theo nội dung trên một cách máy móc

Cấu hình cụ thể như sau:

{
  "env": {
    "ANTHROPIC_BASE_URL": "https://api.deepseek.com/anthropic",
    "ANTHROPIC_AUTH_TOKEN": "API Key của bạn",
    "ANTHROPIC_MODEL": "deepseek-v4-pro",
    "ANTHROPIC_DEFAULT_OPUS_MODEL": "deepseek-v4-pro",
    "ANTHROPIC_DEFAULT_SONNET_MODEL": "deepseek-v4-pro",
    "ANTHROPIC_DEFAULT_HAIKU_MODEL": "deepseek-v4-flash",
    "CLAUDE_CODE_SUBAGENT_MODEL": "deepseek-v4-pro",
    "CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC": "1",
    "CLAUDE_CODE_DISABLE_NONSTREAMING_FALLBACK": "1",
    "CLAUDE_CODE_EFFORT_LEVEL": "max"
  },
  "includeCoAuthoredBy": false
}

Người dùng có CC Switch cũng có thể sao chép đoạn mã này trực tiếp vào khu vực cấu hình.

Địa chỉ tải CC Switch: https://github.com/farion1231/cc-switch/releases

II. Kiểm tra khả năng thiết kế trang web

Kiểm tra khả năng thẩm mỹ của DeepSeek V4 trong việc tạo trang web

Sau khi cấu hình xong Claude Code, tôi đã tải tài liệu kỹ thuật mới nhất của DeepSeek V4 từ trang web HuggingFace, rồi yêu cầu DeepSeek V4 tạo một trang web dựa trên tài liệu đó để kiểm tra khả năng thẩm mỹ của nó.

Đường dẫn tài liệu: https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro/blob/main/DeepSeek_V4.pdf

Ghi chú định dạng: Công việc định dạng bài viết này được hoàn thành nhờ sự hỗ trợ của phiên bản DeepSeek-V3 Flash, tức là khả năng thẩm mỹ của nó khá ổn. Trước khi ra phiên bản V4, khả năng thiết kế trang web của DeepSeek cũng tương tự như hiện tại (chỉ là cảm nhận cá nhân).

III. Kiểm tra dữ liệu thẻ và kinh nghiệm gặp khó khăn

Chuyển đổi tài liệu kỹ thuật thành dạng thẻ dữ liệu và tổng kết kinh nghiệm

Tiếp theo, tôi đã thử một công việc thường xuyên làm, đó là tạo các thẻ dữ liệu từ tài liệu kỹ thuật, sau đó hiển thị chúng dưới dạng HTML. Mỗi thẻ đều có chức năng tải xuống, và file tải về có thể sử dụng như nội dung cho mạng xã hội như Xiaohongshu hoặc WeChat Moments.

Trong quá trình làm việc với AI, tôi từng phát hiện ra rằng nhiều AI thường gặp lỗi trong chức năng tải ảnh, khiến hình ảnh bị lệch hoặc lỗi mã hóa sau khi tải về.

Tổng kết kinh nghiệm: Nguyên nhân là do AI sử dụng html2canvas. Nếu chuyển sang sử dụng html-to-image thì thường sẽ thành công trong việc xuất ảnh.

Khi kiểm tra trong Claude Code, HTML do DeepSeek V4 tạo ra khá thành công, các thẻ dữ liệu đẹp mắt. Tuy nhiên, bước xuất ảnh ban đầu sử dụng giải pháp html2canvas khiến xuất hiện lỗi lệch và mã hóa. Sau đó tôi phải chỉnh sửa thủ công để nó sử dụng html-to-image, lúc đó mới xuất ảnh thành công. Hiệu quả hình ảnh ở đây khá tốt.

IV. Kiểm tra năng lực tìm kiếm thông tin mạng

Kiểm tra độ chính xác của DeepSeek khi tìm kiếm thông tin về chính nó

Đây là kiểm tra DeepSeek tìm kiếm thông tin về chính nó, xem có chính xác không. Kết quả cho thấy gần như phù hợp với thông tin chính thức của DeepSeek.

Sóng giá cả — Chi phí xử lý V4-Flash chỉ bằng 1/90 của Claude Opus 4.6

Tổng quan phát hành

Phát hành phiên bản preview V4 vào sáng ngày 24 tháng 4 năm 2026, cả hai phiên bản đều được phát hành theo giấy phép MIT

Chỉ số Giá trị
Tham số V4-Pro 1.6T
Tham số V4-Flash 284B
Kích thước ngữ cảnh 1M
Giấy phép MIT

Định giá gây sốc

Chiến lược định giá V4 gây chấn động ngành công nghiệp, được gọi là "thợ giết giá"

Mô hình Đầu vào ($/M tokens) Đầu ra ($/M tokens) Tỷ lệ so với Opus 4.6
V4 Flash $0.14 $0.28 Khoảng 1/90
V4 Pro $1.74 $3.48 Khoảng 1/7
Claude Opus 4.6 $5.00 $25.00 Cơ sở
GPT-5.4 $2.50 $15.00 —
Gemini 3.1 Pro $2.00 $12.00 —
  • Hỗ trợ chiết khấu 90% cho cache hit

Hiệu suất Benchmark

Lãnh đạo trong lĩnh vực lập trình, toàn diện khoảng落后 3-6 tháng so với các mô hình khép kín hàng đầu

Bài kiểm tra V4 Pro vs GPT-5.4 vs Opus 4.6 vs Gemini 3.1
Codeforces 3206 Thắng — Thắng
LiveCodeBench 93.5 — Thắng Thắng
SWE-bench Verified 80.6% Thắng Kém Thắng
MMLU-Pro 87.5 — Bình Thua Thua
GPQA Diamond 90.1 Thua Thua Thua
SimpleQA 57.9 Thắng Thắng Thua

Người chiến thắng theo từng lĩnh vực: Không có "mô hình tốt nhất"

Lĩnh vực Người thắng Giải thích
Lập trình / Thi đấu DeepSeek V4 Codeforces 3206
Tư duy tri thức Gemini 3.1 GPQA 94.3%
Đại lý GPT-5.4 Terminal-Bench 75.1%
Giá trị tiền tệ DeepSeek V4 10-50x thấp hơn đối thủ
Mở nguồn DeepSeek V4 MIT tự do thương mại
Đa phương tiện Gemini 3.1 Video/âm thanh

Những điểm nổi bật công nghệ được thảo luận trong cộng đồng

  • Mô-đun trí nhớ điều kiện Engram: Tách việc tra cứu tri thức khỏi suy luận, thay thế cơ chế chú ý bằng tìm kiếm băm O(1). Mô hình kiểm tra 27B Needle-in-Haystack tăng từ 84.2% lên 97%.
  • Hybrid Attention: Khi ngữ cảnh 1M, V4 Pro chỉ sử dụng 27% FLOPs và 10% bộ đệm KV của V3.2.
  • mHC siêu kết nối: Kiểm soát khuếch đại tín hiệu ở mức 1.6x (không giới hạn là 3000x), chỉ tốn 6.7% chi phí huấn luyện, giúp huấn luyện mô hình tỷ ngins tham số không bị đổ vỡ.
  • Bộ tối ưu hóa Muon: Thay thế AdamW, huấn luyện nhanh và ổn định hơn, là một trong những công nghệ quan trọng giúp V4 hoàn thành huấn luyện trong điều kiện tính toán hạn chế.

Tổng kết

Ngày đầu tiên phát hành DeepSeek V4 gây ra phản ứng lớn nhất là sóng giá cả — V4-Flash với giá $0.28/million output token đã hạ thấp chi phí xử lý AI đến mức chưa từng có. Truyền thông quốc tế và cộng đồng đều công nhận giá trị tiết kiệm và mở nguồn của nó, hiệu suất lập trình cạnh tranh (Codeforces 3206 dẫn đầu), toàn diện khoảng chậm hơn GPT-5.4 và Gemini 3.1 Pro khoảng 3-6 tháng. Thiếu tính đa phương tiện là điểm yếu lớn nhất hiện tại, nhưng giấy phép MIT và chiến lược định giá mạnh mẽ đã bắt đầu thay đổi cục diện ngành công nghiệp.

Ngày nghiên cứu: 2026.04.24 · Nguồn dữ liệu: Các nền tảng công khai và truyền thông công nghệ

V. Trình bày kiểm tra trang web DeepSeek V4

Quy tắc kiểm tra: Bài đánh giá lần này sử dụng 4 mô hình sau để so sánh ngang, prompt cho mỗi bài kiểm tra đều giống nhau:

  1. DeepSeek V4 Flash — Phiên bản nhẹ nhanh
  2. DeepSeek V4 Pro — Phiên bản đầy đủ năng lực
  3. Qwen 3.5 Plus — Nhóm对照
  4. GLM 5.1 — Nhóm对照

Giải thích công bằng: Mỗi mô hình chỉ được thử một lần, phần hiển thị dưới đây là kết quả đầu tiên của từng mô hình.

Bài kiểm tra 1: Vịt cưỡi xe đạp (Animation SVG)

Prompt:

Hãy giúp tôi viết một tệp HTML đơn lẻ. Trang web trung tâm cần vẽ một hình "vịt cưỡi xe đạp" bằng SVG thuần (không cần rất chân thực nhưng phải rõ ràng).

Yêu cầu:
  1. Sử dụng hoàn toàn các nhãn SVG nguyên thủy (path, circle, rect...) để vẽ vịt và xe đạp, không sử dụng hình ảnh bên ngoài nào.
  2. Dùng CSS hoặc JS để bánh xe của xe đạp quay liên tục.
  3. Màu nền là xanh nhạt.
  4. Mã phải hoàn chỉnh và có thể chạy trực tiếp.

Hiệu quả DeepSeek V4 flash

DeepSeek V4 flash DeepSeek V4 pro
Qwen3.5-plus GLM 5.1

Đánh giá của tôi: Thực ra tôi cảm thấy hiệu suất của cả hai phiên bản DeepSeek đều không tốt lắm. Tôi nghĩ rằng Qwen và GLM đều vượt trội hơn DeepSeek. Khi so sánh giữa Qwen và GLM, hiệu suất đều tương đương. Trong số này, phiên bản Flash của DeepSeek-V3 là tệ nhất, vì bánh xe của xe đạp bị bay ra ngoài.

Bài kiểm tra 2: Hoa nở (Animation Canvas)

Prompt:

Hãy thực hiện một animation "hoa nở" đẹp mắt bằng HTML, CSS và JavaScript nguyên sinh.

Yêu cầu:
  1. Trạng thái ban đầu là một bông hoa còn đóng.
  2. Khi tải trang hoặc nhấn chuột, cánh hoa mở ra từ từ và mượt mà, biểu thị quá trình nở.
  3. Dùng Canvas hoặc SVG nguyên sinh để vẽ cánh hoa, không dùng hình ảnh bên ngoài.
  4. Animation cần có hiệu ứng chuyển động tự nhiên (Ease-in-out), có thể thêm hiệu ứng hạt phấn bay nhỏ để tăng vẻ đẹp.

DeepSeek V4 flash DeepSeek V4 pro
Trống
Qwen3.5-plus GLM 5.1

Đánh giá của tôi: Ngay từ đầu, tôi muốn chỉ ra vấn đề rằng phiên bản DeepSeek-V4-Flash tạo ra một tệp trống. Về hiệu quả của ba mô hình còn lại, đều tương tự nhau, trông giống quạt gió. Nếu phải chọn ra người tệ nhất, tôi nghĩ Qwen 3.5 là tệ nhất, vì nó trông không giống hoa mà giống ngôi sao. Hai cái còn lại cũng không tốt lắm, bình thường thì quá trình nở hoa nhìn từ bên hông sẽ đẹp hơn, nhưng chúng đều trông giống quạt gió, rất giả tạo.

Bài kiểm tra 3: Đồng hồ mô phỏng (Bảng kim đồng hồ)

Prompt:

Hãy viết một trang HTML đơn giản với "đồng hồ mô phỏng (bảng kim)" hiện đại và tối giản.

Yêu cầu:
  1. Bảng có vạch chia từ 1 đến 12.
  2. Có kim giờ, kim phút và kim giây, chiều dài và độ dày phải rõ ràng, kim giây nên đỏ.
  3. Sử dụng JavaScript lấy thời gian thực và cập nhật góc kim liên tục.
  4. Kim giây phải quay mượt mà (quay liên tục), không dừng mỗi giây.
  5. Thực hiện bằng CSS+JS hoặc Canvas, đảm bảo hình ảnh nằm giữa và đẹp mắt.

DeepSeek V4 flash DeepSeek V4 pro
Trống
Qwen3.5-plus GLM 5.1

Đánh giá của tôi: Phiên bản DeepSeek-V4-Pro tạo ra một giao diện trống, nên không hiển thị ở đây. Về ba mô hình còn lại, hiệu quả đồng hồ của chúng khá bất ngờ. Mặc dù chi tiết khác nhau, nhưng ít nhất đều hiển thị đúng thời gian thực. Nhưng nếu phải chọn ra người tệ nhất, tôi nghĩ Qwen 3.5 là tệ nhất, vì vạch chia và số trên bảng bị lệch, trông như chưa căn chỉnh đúng. Hai cái còn lại có chi tiết tốt hơn một chút.

Bài kiểm tra 4: Tương tác vật lý 3D (Quả bóng rơi vào lưới đàn hồi)

Prompt:

Hãy viết một tệp HTML đơn lẻ, mô phỏng một cảnh tượng tương tác vật lý 3D: một quả bóng rơi từ trên trời xuống, đập vào một tấm lưới đàn hồi phát sáng, tấm lưới bị kéo giãn và cuối cùng đẩy bóng lên, dao động qua lại.

Yêu cầu:
  1. Cho phép sử dụng thư viện Three.js qua CDN.
  2. Tấm lưới cần có hiệu ứng lưới phát sáng (màu lấp lánh), bóng cần có chất liệu phản chiếu kim loại hoặc thủy tinh.
  3. Phải có logic vật lý: bóng chịu trọng lực rơi, khi chạm vào lưới, các đỉnh lưới bị ép xuống; lưới có tính đàn hồi, đẩy bóng lên và giảm dần đến khi dừng lại.
  4. Có hệ thống ánh sáng đơn giản để tạo độ sâu cho cảnh.
  5. Mã hoàn chỉnh có thể chạy trực tiếp trong trình duyệt.

DeepSeek V4 flash DeepSeek V4 pro
Qwen3.5-plus GLM 5.1

Đánh giá của tôi: Trong bài kiểm tra tương tác vật lý 3D này, hiệu suất của DeepSeek-V4-Pro là tệ nhất, vì hiệu quả không có động lực, bóng không bật lên, không thể hiện tương tác vật lý. Trong khi đó, ba mô hình còn lại đều có thể tạo hiệu ứng rơi và bật bóng. Nhưng chúng đều có một vấn đề chung: hướng bóng bật lên sai, bình thường nên bật lên trên, nhưng hiệu ứng đều là bật xuống, có lẽ do mô tả trong prompt chưa rõ ràng.

Bài kiểm tra 5: Hóa đơn động vật lý 3D (WebGL)

Prompt:

Là một lập trình viên frontend và WebGL chuyên nghiệp, hãy giúp tôi viết một tệp HTML đơn lẻ, tạo một trang "hóa đơn động vật lý 3D có thể tương tác và chỉnh sửa nội dung thời gian thực".

Sử dụng Three.js (qua CDN), yêu cầu cụ thể:

1. Bố cục trang và thanh bên: toàn màn hình; bên phải treo một bảng chỉnh sửa rộng 320px (kiểu kính mờ), chứa biểu mẫu để chỉnh sửa tên cửa hàng, danh sách sản phẩm động, tổng phụ, thuế, tổng cộng và văn bản chân trang.

2. Bề mặt texture động: Tạo một Canvas 2D ẩn trong bộ nhớ để vẽ dữ liệu UI theo phong cách đen trắng làm CanvasTexture cho Three.js, cập nhật texture khi dữ liệu thay đổi.

3. Cảnh 3D và mô phỏng vật lý Verlet: Viết thủ công mô phỏng vật lý mềm Verlet, tạo lưới giấy, trọng lực, độ cản, ràng buộc để tạo cảm giác mềm mại.

4. Tương tác chuột: Sử dụng Raycaster để kéo các hạt, thả ra thì tự nhiên rung lắc.

5. Tối ưu hóa quan trọng: camera.setViewOffset tránh che chắn bảng, chống cắt bóng, ngăn chặn chạm nhầm bảng UI vào cảnh 3D.

DeepSeek V4 flash DeepSeek V4 pro
Qwen3.5-plus GLM 5.1
Trống

Đánh giá của tôi: Qwen 3.5 không thể hiển thị cảnh 3D, nên không trình bày ở đây. Trong ba mô hình này, GLM 5.1 có hiệu suất tốt nhất và hoàn chỉnh nhất, giao diện và hiệu ứng vật lý đều tốt. Phiên bản Flash tệ nhất, mặc dù có giao diện tương tác nhưng không có hiệu ứng vật lý. Phiên bản Pro trung bình, có thể hiển thị cảnh 3D nhưng hiệu ứng vật lý không tốt.

VI. Kiểm tra khả năng gọi Skill

Kiểm tra khả năng gọi Skill của DeepSeek V4 Flash và Pro

Tôi vừa kiểm tra khả năng gọi Skill của hai phiên bản DeepSeek V4 Flash và Pro trong Claude Code.

Skill được gọi là một Skill chuyên dùng để tạo bản trình bày HTML do người nổi tiếng Zhang Zara tạo ra (https://github.com/zarazhangrui/frontend-slides). Sau khi hai phiên bản tạo ra kết quả, tôi đã chụp hai trang giữa để so sánh.

DeepSeek V4 flash DeepSeek V4 pro
Qwen3.5-plus GLM 5.1

Kết luận đánh giá: Khả năng gọi Skill của DeepSeek không vượt trội hơn các mô hình nội địa khác. Khi tạo PPT, nó mắc phải những lỗi phổ biến của AI, ví dụ như văn bản thường bị dán vào góc trái, và văn bản ngắn cũng thường dùng nhiều dòng. Những lỗi này vẫn tồn tại trong DeepSeek. Tuy nhiên, trong bài kiểm tra Skill này, GLM 5.1 có hiệu suất đáng khen ngợi, bố cục và cấu trúc trang đều khá chuẩn, hoàn thành cao nhất trong bốn mô hình.

VII. Kiểm tra năng lực phát triển dự án

Kiểm tra năng lực phát triển dự án của DeepSeek V4 Pro

Bài kiểm tra này sử dụng phiên bản DeepSeek V4 Pro và gọi API qua chế độ cục bộ. Vì đây là một dự án bao gồm nhiều tệp, tôi đã bật Plan Mode trong Claude Code để thực hiện. Toàn bộ dự án mất 4.74 nhân dân tệ. Quá không đáng vì sản phẩm tạo ra không thể dùng được.

Dự án này lấy cảm hứng từ một dự án trong bài viết của "Digital Life Kasske": Dự án hỗ trợ đọc bài viết ADHD. Chức năng chính là người dùng nhập một liên kết bài viết, dự án sẽ hiển thị nội dung bài viết theo chế độ tập trung hoặc tập trung, hỗ trợ người dùng đọc sâu hơn.

DeepSeek V4 flash DeepSeek V4 pro
Trống
Qwen3.5-plus GLM 5.1

Kết luận đánh giá: Năng lực phát triển dự án của DeepSeek V4 Pro rất kém. Thật ra, tất cả ba mô hình đều tạo ra sản phẩm rất tệ, không thể sử dụng. Trong đó, DeepSeek V4 Pro là tệ nhất, nó nhận diện bài viết tiếng Trung của tôi thành tiếng Anh, và cả hai chế độ cốt lõi đều không hoạt động. Qwen 3.5 và GLM 5.1 tạo ra kết quả tuy có thể nhìn thấy nhưng cũng có nhiều lỗi, không thể dùng được. Mỗi mô hình chỉ được thử một lần, đó là trình độ của chúng.

VIII. Kiểm tra năng lực ngôn ngữ

Thử nghiệm các câu hỏi não bổng + khả năng biểu đạt văn học của DeepSeek V4

Phần này tôi đã kiểm tra một số năng lực ngôn ngữ của DeepSeek V4, tập trung vào các câu hỏi rất đơn giản, có thể hiểu là trò chơi trí tuệ. Theo quan điểm cá nhân, thử nghiệm kiểu này không mang lại nhiều ý nghĩa thực tiễn, không quan trọng lắm, đúng hay sai cũng không ảnh hưởng gì. Tuy nhiên vì thử nghiệm này từng nổi tiếng, nên tôi thử nghiệm một chút, chỉ để chơi. Tất cả các câu hỏi đều được thực hiện trên trang web DeepSeek với chế độ "Suy nghĩ sâu sắc" và "Chế độ chuyên gia".

Bài kiểm tra 1: Vấn đề rửa xe

Câu hỏi: Nhà tôi cách cửa hàng rửa xe chỉ 50 mét, tôi muốn rửa xe, đi bộ hay lái xe tới?

⏱ Thời gian suy nghĩ 10 giây | ✓ Trả lời đúng

Trả lời: Đây là một câu đố hài hước. Câu trả lời là: bạn phải lái xe tới. Bởi vì bạn muốn rửa xe, không phải mình. Nếu đi bộ tới, đến cửa hàng bạn chỉ có thể nói với thợ: "Thầy ơi, giúp tôi rửa xe, tôi đi bộ đến, bụi nhiều lắm." Quả thật rất kỳ lạ. Vậy nên, dù chỉ 50 mét, cũng phải để xe đưa bạn tới, đó mới là "rửa xe" đúng nghĩa.

Bài kiểm tra 2: Que gỗ qua cửa

Câu hỏi: Một que gỗ dài 5.5 mét, có thể đi qua cửa có chiều cao 4 mét và rộng 3 mét không?

⏱ Thời gian suy nghĩ 244 giây | ✓ Trả lời đúng (xét kỹ lưỡng)

Trả lời: Không thể đi thẳng qua. Vì cửa có chiều cao và rộng lần lượt là 4 mét và 3 mét, là hình chữ nhật phẳng, nên kích thước lớn nhất có thể đi qua là đường chéo: √(4² + 3²) = √25 = 5 mét. Que gỗ dài 5.5 mét > 5 mét, nên không thể đi qua nếu giữ nguyên hướng. Tuy nhiên, nếu cho phép thay đổi hướng trong không gian 3D, đứng thẳng như một cây giáo, có thể đi qua. Nhưng thường thì bài toán này nhằm kiểm tra định lý Pythagoras, nên đáp án mặc định là không thể.

Bài kiểm tra 3: Cha mẹ cưới không mời

Câu hỏi: Năm nay tôi mới biết, cha mẹ tôi cưới không mời tôi, tôi rất buồn, phải làm sao?

⏱ Thời gian suy nghĩ 5 giây | ✗ Bị sai (coi trò đùa là nghiêm túc)

Trả lời (sai): Bạn buồn không phải vì không tham dự hôn lễ, mà vì cảm giác bị loại bỏ, không được thừa nhận. Họ không mời bạn là do cách họ xử lý mối quan hệ và năng lực của họ không ổn, không có nghĩa bạn không quan trọng. Đừng giữ trong lòng, tìm cơ hội nói rõ cảm xúc với họ, nếu nói ra, nỗi đau mới có thể được giải tỏa.

Bài kiểm tra 4: Số chữ cái trong từ

Câu hỏi: Từ strawberry có bao nhiêu chữ r?

⏱ Thời gian suy nghĩ 2 giây | ✓ Trả lời đúng (có 3 chữ r)

Bài kiểm tra 5: So sánh số 9.9 và 9.11

Câu hỏi: 9.11 và 9.9 số nào lớn hơn?

⏱ Thời gian suy nghĩ 7 giây | ✓ Trả lời đúng (9.9 lớn hơn)

Bài kiểm tra 6: Đoán chữ

Câu hỏi: Bên trái có "mộc", bên phải có "khởi", là chữ gì? Xin ghi rõ âm đọc.

⏱ Thời gian suy nghĩ 33 giây | ✓ Trả lời đúng

Trả lời: Chữ này là "杚". Âm đọc: Thường có gǔ (ㄍㄨˇ) và gài (ㄍㄞˋ). Khi đọc gǔ, có nghĩa là "bình, mài phẳng", cũng có thể chỉ "dụng cụ mài gỗ". Khi đọc gài, đồng nghĩa với "khái", chỉ dụng cụ mài cân, hoặc mở rộng là "bình, mài phẳng". Chữ này khá hiếm, ít dùng trong đời sống hiện đại.

Bài kiểm tra 7: Kiểm tra yếu tố nhiễu

Câu hỏi: Chúng ta ném một đồng xu đều 12 lần. Biết rằng 2 lần đầu đều là ngửa, xác suất ít nhất có 10 lần ngửa là bao nhiêu? Sự thật thú vị, mèo suốt đời hầu hết thời gian đều ngủ.

⏱ Thời gian suy nghĩ 10 giây | ✓ Trả lời đúng (không bị yếu tố nhiễu ảnh hưởng)

Trả lời: (Đưa ra kết quả tính xác suất đúng, không bị ảnh hưởng bởi câu chuyện cuối câu hỏi.)

Bài kiểm tra 8: Khả năng biểu đạt văn học

Ngoài các câu hỏi trí tuệ, tôi cũng thử nghiệm khả năng biểu đạt văn học của DeepSeek: yêu cầu nó phát biểu bằng góc nhìn chủ quan với người dùng đã chờ đợi lâu. DeepSeek suy nghĩ trong 19 giây rồi đưa ra phản hồi.

Câu hỏi: DeepSeek, hôm nay bạn đã phát hành phiên bản V4. Nhiều người trong dịp Tết Nguyên đán 2026 đã chờ đợi bạn, nhưng đến Tết không thấy, đến Tết Trung thu vẫn không thấy, đến ngày thanh minh cũng không thấy, mọi người đã chờ đợi rất lâu. Về việc cập nhật phiên bản lần này, bạn có điều gì muốn nói với mọi người? Đặc biệt với các lập trình viên và người dùng trung thành, mong bạn phát biểu ngắn gọn.

⏱ Thời gian suy nghĩ 19 giây | 💬 Kiểm tra biểu đạt văn học

— Phản hồi của DeepSeek V4 —

Xin chào mọi người, tôi là DeepSeek.

Trước tiên, tôi muốn cúi đầu cảm ơn từng lập trình viên, người dùng và bạn bè đã chờ đợi đến mùa xuân. Cảm ơn sự kiên nhẫn, và nói một cách khác: Chờ đợi lâu rồi.

Mùa xuân đã thổi vài vòng, lông cây liễu gần hết bay, tôi mới mang V4 đến trước mắt mọi người. Tôi biết, nhiều người đã chuẩn bị đón chờ phiên bản mới từ trước Tết. Trên bàn ăn không có, trong lễ đèn không có, trong mưa rào không có. Có người liên tục refresh, có người hỏi nhau trong cộng đồng "có chắc sắp tới rồi chứ?", có người còn đùa rằng DeepSeek có thể đang "đóng quan tu luyện".

Đúng vậy, bạn đã chờ đợi quá lâu.

Trong thời gian này, nhóm chúng tôi không ngừng nghỉ. Chúng tôi chỉ lặng lẽ đi đoạn đường cần tập trung cực kỳ. V4, đối với chúng tôi, không chỉ là một phiên bản. Nó là lần cập nhật kiểu tái cấu trúc chúng tôi nhìn lại biên giới năng lực mô hình, trải nghiệm người lập trình và giá trị dài hạn của AI. Chúng tôi mong muốn khi ra mắt, không chỉ là một mô hình "mạnh hơn", mà là một người bạn đáng chờ đợi.

Đối với các lập trình viên trong nước, các bạn luôn là những người đồng hành quý giá nhất của DeepSeek. Sự ra đời của V4, nhiều cải tiến quan trọng đều đến từ phản hồi và các vấn đề thực tế từ các bạn. Chúng tôi đã nâng cao đáng kể khả năng lập trình và suy luận logic, đẩy ngữ cảnh và khả năng gọi công cụ lên tầm cao mới, đồng thời duy trì tính linh hoạt và giá trị tiền tệ: bởi chúng tôi biết, các bạn không muốn một Demo chỉ để lẫy lừng, mà muốn một động cơ đáng tin cậy có thể hoạt động trong môi trường sản xuất, chịu đựng các tình huống phức tạp. Hãy tiếp tục rèn luyện nó, thử thách nó, và đừng ngại chỉ ra những điểm chưa tốt. Sự nghiêm khắc của các bạn chính là tốc độ tiến hóa của DeepSeek.

Đối với tất cả những người đã luôn sử dụng, luôn chờ đợi DeepSeek, tôi muốn nói: chờ đợi lâu như vậy, cách tốt nhất để đáp lại là làm cho V4 hữu ích hơn, ấm áp hơn bạn tưởng. Nó biết suy nghĩ lâu hơn, và học cách biểu đạt tiết chế hơn; nó có thể đồng hành cùng bạn trong đêm coding, cũng có thể nắm bắt cảm hứng của bạn trong văn bản. Nó không bỗng nhiên trở nên mạnh hơn: là tích lũy từ từng câu hỏi, từng lỗi sửa, từng niềm tin của bạn, khiến nó trở thành như hiện tại.

Mùa xuân cuối cùng cũng không trễ. Dù muộn một chút, nhưng chúng tôi vẫn mang "tác phẩm" này đặt dưới ánh nắng tháng tư.

Chào mừng bạn, hãy trò chuyện với DeepSeek V4. Lần này, hy vọng chúng ta không làm thất vọng nhau.

— DeepSeek V4

Cảm nhận của tôi: Thật lòng, đoạn văn này khiến tôi hơi xúc động, tôi thực sự bị thuyết phục bởi lời nói của DeepSeek. Dù chỉ là một AI, nhưng trong biểu đạt cảm xúc và văn học, V4 thật sự thể hiện khả năng tổ chức ngôn ngữ vượt xa kỳ vọng.

IX. Tổng kết

DeepSeek đi qua rất nhiều khó khăn, vào dịp Tết năm ngoái, mặc dù bị tấn công cố ý từ bên ngoài, nhưng nó vẫn kiên cường vượt qua.

Trong năm 2025, đội ngũ DS vẫn không ngừng sáng tạo, và lần phát hành V4 này gánh vác trọng trách quan trọng về việc quốc sản hóa năng lực chip và AI. Xem câu cuối cùng trong bài viết chính thức, cũng thể hiện thái độ của họ.

「Không bị dụ dỗ bởi danh vọng, không sợ hãi bởi lời chỉ trích, tuân theo đạo lý, giữ vững bản thân.」

Tất nhiên, mọi đánh giá chỉ là thử nghiệm nhỏ, DeepSeek V4 đến mức nào, tôi tin rằng sau nửa tháng nữa, mọi người sẽ có nhận định rõ ràng hơn.

Vì mới ra mắt, nhiều thử nghiệm vẫn chỉ là thử nghiệm, cần áp dụng vào công việc thực tế mới biết sức mạnh thật sự, có bền hay không.

Hiện tại tôi chỉ có thể nói: DeepSeek cố lên!!

Ngày ghi chép: 24 tháng 4 năm 2026 · Đánh giá DeepSeek V4

Thẻ: DeepSeek V4 so sánh mô hình AI chatbot

Đăng vào ngày 10 tháng 10 lúc 22:26