Skip to content

[ATOM-vLLM] Add support for Qwen3.8 - #1901

Open
kliuae wants to merge 1 commit into
ROCm:mainfrom
kliuae:atom-vllm-qwen38
Open

[ATOM-vLLM] Add support for Qwen3.8#1901
kliuae wants to merge 1 commit into
ROCm:mainfrom
kliuae:atom-vllm-qwen38

Conversation

@kliuae

@kliuae kliuae commented Aug 14, 2026

Copy link
Copy Markdown
Contributor

Motivation

This PR adds support for Qwen3.8 in ATOM-vLLM mode.
Currently only tested with MXFP4 weights on single-node MI355 x8.

Technical Details

  • Add and register text-only Qwen3_5
  • Resolve ssm state dtype to dtype from model config unless otherwise set

Test Plan

lm_eval with gsm8k (single node MI355 x8, TP8)

Model: amd/Qwen3.8-2.4T-A95B-Quark-MXFP4

Server command

TP=8
export VLLM_ROCM_USE_AITER=1
export ATOM_ENABLE_QK_NORM_ROPE_CACHE_QUANT_FUSION=1
export ATOM_USE_CUSTOM_ALL_GATHER=0
export ATOM_FP8_BLOCKSCALE_WEIGHT_PRESHUFFLE=0
export GATED_DELTA_RULE_TRITON_AUTOTUNE=1

vllm serve amd/Qwen3.8-2.4T-A95B-Quark-MXFP4 \
    --host localhost \
    --port 8000 \
    --tensor-parallel-size "${TP}" \
    --kv-cache-dtype fp8 \
    --async-scheduling \
    --trust-remote-code \
    --max-num-batched-tokens 16384 \
    --max-model-len 16384 \
    --compilation-config '{"cudagraph_mode": "FULL_AND_PIECEWISE"}' \
    --gpu-memory-utilization 0.9 \
    --no-enable-prefix-caching

lm_eval

lm_eval --model local-completions \
        --model_args model=amd/Qwen3.8-2.4T-A95B-Quark-MXFP4,base_url=http://localhost:8000/v1/completions,num_concurrent=64,max_retries=3,tokenized_requests=False \
        --tasks gsm8k \
        --num_fewshot 5 \
        --gen_kwargs max_gen_toks=2048

Test Result

gsm8k

local-completions ({'model': 'amd/Qwen3.8-2.4T-A95B-Quark-MXFP4', 'base_url': 'http://localhost:8000/v1/completions', 'num_concurrent': 64, 'max_retries': 3, 'tokenized_requests': False}), gen_kwargs: ({'max_gen_toks': 2048}), limit: None, num_fewshot: 5, batch_size: 1

Tasks Version Filter n-shot Metric Value Stderr
gsm8k 3 flexible-extract 5 exact_match 0.9591 ± 0.0055
strict-match 5 exact_match 0.9598 ± 0.0054

Submission Checklist

Signed-off-by: kliuae <kuanfu.liu@embeddedllm.com>
@github-actions

Copy link
Copy Markdown
Contributor

🏷️ CI Guide

Runs automatically on every eligible PR before approval:

  • ✅ Pre Checkin: Black, Ruff, catalog schema validation, non-GPU unit tests

Heavy model tests:

  • ✅ Run after the PR is approved and Pre Checkin passes
  • ✅ Run immediately when an approval review is submitted
  • ✅ Can be requested before approval with labels
Label Tests
ci:full Run all heavy PR model tests: native ATOM, vLLM, and SGLang
ci:atom Run native ATOM model accuracy tests
ci:vllm Run ATOM vLLM OOT model accuracy tests
ci:sglang Run ATOM SGLang model accuracy tests

Heavy jobs are skipped when the PR is not approved and no matching ci:* label is present.
Add labels via the sidebar or gh pr edit 1901 --add-label <label>

@zufayu
zufayu requested a review from valarLip August 17, 2026 01:35
Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

None yet

Projects

None yet

Development

Successfully merging this pull request may close these issues.

1 participant