[Feature]: Kimi K3 Performance Optimization
Author: yewentao256Created Jul 31, 2026Updated Sep 17, 2026
Labelsfeature requestkimik3
The feature, motivation and pitch
Tasks
- https://github.com/vllm-project/vllm/pull/50383 @jeejeelee
- https://github.com/vllm-project/vllm/pull/51146 @jeejeelee
- https://github.com/vllm-project/vllm/pull/50478 @robertgshaw2-redhat
- https://github.com/vllm-project/vllm/pull/50484 @GirasoleY
- https://github.com/vllm-project/vllm/pull/50510 @huangzhilin-hzl
- https://github.com/vllm-project/vllm/pull/50585 @yewentao256
- https://github.com/vllm-project/vllm/pull/50656 @tlrmchlsmth
- https://github.com/vllm-project/vllm/pull/50912 @yewentao256
- https://github.com/vllm-project/vllm/pull/51070 @yewentao256
- https://github.com/vllm-project/vllm/pull/51311 @yewentao256
- https://github.com/vllm-project/vllm/pull/51540 @njhill
- https://github.com/vllm-project/vllm/pull/51725 + https://github.com/vllm-project/vllm/pull/51726 @yewentao256
- https://github.com/vllm-project/vllm/pull/51772 @zyongye
- https://github.com/vllm-project/vllm/pull/52388 @yewentao256
- https://github.com/vllm-project/vllm/pull/52458 @BabyDrangoner
- https://github.com/vllm-project/vllm/pull/52789 @yewentao256 @ZeldaHuang + https://github.com/vllm-project/vllm/pull/53614 @ZeldaHuang
- https://github.com/vllm-project/vllm/pull/52993 @hnover-nv + https://github.com/vllm-project/vllm/pull/56082 @gcanlin
- https://github.com/vllm-project/vllm/pull/53053 + https://github.com/vllm-project/vllm/pull/52079 @gau-nernst
- https://github.com/vllm-project/vllm/pull/53152 @yewentao256 + https://github.com/vllm-project/vllm/pull/53327 @zyongye
- https://github.com/vllm-project/vllm/pull/53168 @gcanlin
- https://github.com/vllm-project/vllm/pull/53396 @gcanlin
- https://github.com/vllm-project/vllm/pull/53524 @mingg26
- https://github.com/vllm-project/vllm/pull/53525 @mingg26
- https://github.com/vllm-project/vllm/pull/53534 @gcanlin
- https://github.com/vllm-project/vllm/pull/53556 @gcanlin
- https://github.com/vllm-project/vllm/pull/53794 @wzhao18
- https://github.com/vllm-project/vllm/pull/53942 @yewentao256
- https://github.com/vllm-project/vllm/pull/54088 @yewentao256
- https://github.com/vllm-project/vllm/pull/54015 @gau-nernst
- https://github.com/vllm-project/vllm/pull/54151 @gau-nernst
- https://github.com/vllm-project/vllm/pull/54168 @zyongye
- https://github.com/vllm-project/vllm/pull/54254 @rebklee
- https://github.com/vllm-project/vllm/pull/54255 @djmmoss
- https://github.com/vllm-project/vllm/pull/54261 @zyongye
- https://github.com/vllm-project/vllm/pull/54347 @gcanlin
- https://github.com/vllm-project/vllm/pull/54447 @gcanlin
- https://github.com/vllm-project/vllm/pull/54565 @yewentao256
- https://github.com/vllm-project/vllm/pull/54606 @BolinSNLHM
- https://github.com/vllm-project/vllm/pull/54697 @zyongye
- https://github.com/vllm-project/vllm/pull/54896 @zyongye
- https://github.com/vllm-project/vllm/pull/55242 @wzhao18
- https://github.com/vllm-project/vllm/pull/55356 @yewentao256
- https://github.com/vllm-project/vllm/pull/55364 @wzhao18
- https://github.com/vllm-project/vllm/pull/56159 @yewentao256
- https://github.com/vllm-project/vllm/pull/56510 @gcanlin
For Rocm: https://github.com/vllm-project/vllm/issues/50682
Alternatives
No response
Additional context
I don't have enough GPU resources to run an end-to-end benchmark currently. If you have available GPU capacity and are willing to share access, I would greatly appreciate it!
Before submitting a new issue...
- Make sure you already searched for relevant issues, and asked the chatbot living at the bottom right corner of the documentation page, which can answer lots of frequently asked questions.
Source: vllm-project/vllm