Skip to content

[BUG] --kv-cache-dtype=int8 has no effect (kv cache is not quantized) #552

Description

@BoBoDai

版本 0.1.0

问题描述

--kv-cache-dtype=int8 参数不生效,kv cache 完全没有被量化。运行 python examples/test_infer.py --model=<模型路径> --kv-cache-dtype=int8 后,输出与不传该参数完全一致,通过日志进行查看kv-cache-dtype为NONE。

环境:Linux + NVIDIA GPU(硬件平台),InfiniLM 0.1.0(软件环境)。排查发现 kv_cache_dtype 从 CLI 到 engine 的 Python 透传链路是断的:test_infer.py / LLM / EngineConfig / ModelRunner 均未传递该参数,flag 到 engine 前就被静默丢弃,C++ 侧收到 None,量化 scheme 保持 NONE,int8 路径完全不会执行。

如何复现

加载任意 llama 模型(如 TinyLlama-1.1B-Chat)
运行 python examples/test_infer.py --model=<模型路径> --kv-cache-dtype=int8
与不带 --kv-cache-dtype 的运行对比
观察输出完全一致,无任何量化发生

预期结果

开启后 kv cache 以 int8 存储(内存减半),量化路径被实际执行。

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Type

    No type

    Projects

    No projects

      Milestone

      No milestone

      Relationships

      None yet

      Development

      No branches or pull requests

      Issue actions