Login
Back to Blog
Tiếng ViệtComparison

Kimi K3 so với Claude Fable 5: mô hình nào phù hợp hơn cho tác vụ cần kiểm chứng?

Bài kiểm thử API thực tế trên toán học, vật lý, Python chạy được và suy luận ràng buộc, đồng thời đo finish_reason, reasoning tokens và độ trễ.

C
Crazyrouter Team
July 17, 2026 / 49 views
Share:
Kimi K3 so với Claude Fable 5: mô hình nào phù hợp hơn cho tác vụ cần kiểm chứng?

Kimi K3 so với Claude Fable 5: mô hình nào phù hợp hơn cho tác vụ cần kiểm chứng?#

Kimi K3 so với Claude Fable 5

Trong hệ thống thật, một phản hồi thành công chưa chắc là một kết quả dùng được. Bài test này kiểm tra cả bước tính trung gian, finish_reason và khả năng chạy của mã Python.

Khác biệt chính#

Fable 5 có độ trễ trung bình 37,1 giây, trong khi Kimi K3 là 108,0 giây. Đổi lại, Kimi K3 tạo chuỗi kiểm chứng toán học nhất quán hơn.

Lập trình: ngân sách đầu ra quyết định tính hoàn chỉnh#

Hàm Python phải gộp retry theo request_id, đọc thời gian ISO-8601, lọc khoảng nửa kín [start,end), tổng hợp token và độ trễ, rồi sắp xếp theo nhiều khóa.

text
Round 1, max_tokens=4000:
Kimi K3 finish_reason=length
Fable 5 finish_reason=length

Retry, max_tokens=7000:
Kimi K3: 145.2 s, 5199 completion tokens, 8/8 assertions
Fable 5: 46.6 s, 3710 completion tokens, 8/8 assertions

Ở mức 4.000 tokens, cả hai kết thúc với length. Khi tăng lên 7.000, hai chương trình Python đều vượt qua tám assert giống nhau.

Thiết kế bài test#

text
Test date: 2026-07-17
Base URL: https://cn.crazyrouter.com/v1
Endpoint: POST /v1/chat/completions
Models: kimi-k3, claude-fable-5
temperature: 0.2
Round 1 max_tokens: 4000
Coding retry max_tokens: 7000

Hai mô hình nhận cùng prompt và cùng tiêu chí nghiệm thu. HTTP 200 không được xem là đủ: chúng tôi kiểm tra giá trị cuối, trạng thái trung gian, finish_reason, Python có thể chạy và cùng một bộ assertion.

Kết quả tổng hợp#

Tác vụKimi K3Claude Fable 5
Xác suất HHTHĐạtKết quả cuối đúng; sai số học ở bước trung gian
Va chạm và lò xoĐạtĐạt
Tổng hợp PythonBị cắt ở 4k; đạt ở 7kBị cắt ở 4k; đạt ở 7k
Lịch ràng buộcĐạtĐạt
text
Độ trễ trung bình — Kimi K3: 108.0 s
Độ trễ trung bình — Claude Fable 5: 37.1 s

Bài toán: đáp án cuối đúng chưa đủ#

Bài toán đồng xu lệch yêu cầu tính số lần tung kỳ vọng trước lần xuất hiện đầu tiên của HHTH, với P(H)=3/5 và cho phép chồng lấn. Kết quả đúng là:

text
E[T] = 715/54 ≈ 13.2407407407
E1 = 625/54
E2 = 475/54
E3 = 170/27

Kimi K3 đối chiếu phương trình trạng thái với hai cách kiểm tra độc lập. Fable 5 có đáp án cuối đúng nhưng hai giá trị trung gian không khớp với chính phương trình của nó.

Vật lý: cả hai mô hình đều đúng#

Bài vật lý kết hợp va chạm hoàn toàn không đàn hồi, ma sát và nén lò xo. Cả hai mô hình đều cho:

text
Post-collision speed: 2.4 m/s
Energy lost in collision: 21.6 J
Maximum compression: about 0.2212 m

Cả hai tính được độ nén lò xo khoảng 0,2212 m và lịch duy nhất Eli, Bo, Ada, Cici, Deng.

Ý nghĩa của reasoning tokens khi vận hành#

text
Kimi K3 completion tokens: 13,975
Kimi K3 reasoning tokens: about 12,500
Fable 5 completion tokens: 10,187

Kimi K3 báo cáo khoảng 12.500 reasoning tokens. Việc suy luận sâu hơn đi cùng độ trễ cao hơn và ít không gian hơn cho mã hiển thị.

Suy luận ràng buộc: cùng một nghiệm duy nhất#

Cả hai mô hình đều tìm được lịch làm việc duy nhất:

Thứ haiThứ baThứ tưThứ nămThứ sáu
EliBoAdaCiciDeng

Cả hai tính được độ nén lò xo khoảng 0,2212 m và lịch duy nhất Eli, Bo, Ada, Cici, Deng.

Gợi ý định tuyến mô hình#

  • Dùng Fable 5 trước cho mã có thể test tự động
  • Giữ Kimi K3 cho suy luận toán chính xác
  • Luôn kiểm tra finish_reason và chạy test

Giới hạn của phép thử#

Đây là mẫu thử nhỏ, không phải bảng xếp hạng phổ quát. Đánh giá production nên lặp mỗi nhóm 20–50 lần và đo tỷ lệ thành công, tỷ lệ bị cắt, thời gian tới token đầu tiên, P50/P95/P99, completion tokens và chi phí cho mỗi kết quả được chấp nhận.

Kết luận#

Trong lần thử này, Fable 5 là tuyến phản hồi nhanh; Kimi K3 là tuyến thận trọng hơn cho các bước toán trung gian.

python
from openai import OpenAI

client = OpenAI(api_key="YOUR_API_KEY", base_url="https://cn.crazyrouter.com/v1")
response = client.chat.completions.create(
    model="kimi-k3",
    temperature=0.2,
    max_tokens=4000,
    messages=[{"role": "user", "content": "YOUR_TEST_PROMPT"}],
)
print(response.model, response.choices[0].finish_reason, response.usage)

Bài đầy đủ: https://crazyrouter.com/vi/blog/kimi-k3-vs-claude-fable-5-hard-reasoning-benchmark-2026-vi

API: https://crazyrouter.com/register?utm_source=crazyrouter_blog&utm_medium=article&utm_campaign=kimi_k3_fable5_multilingual_20260718&utm_content=kimi-k3-vs-claude-fable-5-hard-reasoning-benchmark-2026-vi__body_cta&utm_term=kimi-k3+claude-fable-5+benchmark

Implementation Guides

Topics

Comparison

Related Posts

GLM-5.2 vs Claude Fable 5: ngân sách đầu ra, reasoning_tokens và mức discount 0.8Comparison

GLM-5.2 vs Claude Fable 5: ngân sách đầu ra, reasoning_tokens và mức discount 0.8

Bài kiểm thử thực tế qua Crazyrouter OpenAI-compatible API, so sánh glm-5.2 và claude-fable-5 trên bài toán toán học, vật lý và HTML Canvas animation, kèm ghi chú về discount 0.8 hiện tại của glm-5.2.

Jul 6
Kimi K3 so với GPT-5.6-SOL: Thử nghiệm độ khó cao về toán, vật lý và lập trìnhComparison

Kimi K3 so với GPT-5.6-SOL: Thử nghiệm độ khó cao về toán, vật lý và lập trình

Trong cùng một API tương thích OpenAI và cùng một prompt, tiến hành kiểm tra kimi-k3 và gpt-5.6-sol với các bài toán về thời gian dừng ở chế độ, vật lý có mô-men quán tính của ròng rọc và bài lập trình Python dùng closure lồng nhau, đồng thời ghi nhận độ chính xác, hiện tượng cắt ngắn, độ trễ và xác thực mã cục bộ.

Jul 18
Kimi K3 so với Claude Opus 4.8: Thử nghiệm thực tế về toán, vật lý và lập trình cấp độ sau đại họcComparison

Kimi K3 so với Claude Opus 4.8: Thử nghiệm thực tế về toán, vật lý và lập trình cấp độ sau đại học

Trên cùng một Crazyrouter OpenAI-compatible API, so sánh kimi-k3 và claude-opus-4-8 bằng các bài toán cấp độ sau đại học về thời gian chạm đầu tiên của chuỗi Markov, phổ đáp ứng của dao động tử ghép có suy giảm và thuật toán lập lịch phụ thuộc, đồng thời ghi lại độ đầy đủ của đầu ra, độ chính xác, độ trễ và kết quả thẩm định độc lập.

Jul 19
Kimi K3 đã đạt tới mức Claude Opus 4.8 chưa? Thử nghiệm API qua 7 chiềuComparison

Kimi K3 đã đạt tới mức Claude Opus 4.8 chưa? Thử nghiệm API qua 7 chiều

So sánh Kimi K3 và Claude Opus 4.8 qua bảy chiều: toán học chính xác, mô hình hóa vật lý, suy luận ràng buộc, chống dẫn dụ thống kê, rà soát mã, JSON nghiêm ngặt và hiệu chuẩn độ bất định; tập trung vào độ đúng, câu trả lời hiển thị đầu tiên, tổng độ trễ và hiệu quả reasoning token.

Jul 19
Cổng API AI Tốt Nhất Cho Nhà Phát Triển Năm 2026: 9 Nền Tảng Được Kiểm TraComparison

Cổng API AI Tốt Nhất Cho Nhà Phát Triển Năm 2026: 9 Nền Tảng Được Kiểm Tra

Chúng tôi đã kiểm tra 9 cổng API AI về phạm vi mô hình, giá cả, hỗ trợ đa phương tiện và trải nghiệm nhà phát triển.

Mar 27
Ngày phát hành ChatGPT 6: Dòng thời gian mới nhất, Dự đoán và Những gì cần làm ngay bây giờTutorial

Ngày phát hành ChatGPT 6: Dòng thời gian mới nhất, Dự đoán và Những gì cần làm ngay bây giờ

Tất cả những gì chúng ta biết về ngày phát hành ChatGPT 6, các tính năng dự kiến và những gì các nhà phát triển nên làm trong khi chờ đợi.

Mar 27