版本 0.1.0
问题描述
--kv-cache-dtype=int8 参数不生效,kv cache 完全没有被量化。运行 python examples/test_infer.py --model=<模型路径> --kv-cache-dtype=int8 后,输出与不传该参数完全一致,通过日志进行查看kv-cache-dtype为NONE。
环境:Linux + NVIDIA GPU(硬件平台),InfiniLM 0.1.0(软件环境)。排查发现 kv_cache_dtype 从 CLI 到 engine 的 Python 透传链路是断的:test_infer.py / LLM / EngineConfig / ModelRunner 均未传递该参数,flag 到 engine 前就被静默丢弃,C++ 侧收到 None,量化 scheme 保持 NONE,int8 路径完全不会执行。
如何复现
加载任意 llama 模型(如 TinyLlama-1.1B-Chat)
运行 python examples/test_infer.py --model=<模型路径> --kv-cache-dtype=int8
与不带 --kv-cache-dtype 的运行对比
观察输出完全一致,无任何量化发生
预期结果
开启后 kv cache 以 int8 存储(内存减半),量化路径被实际执行。
版本 0.1.0
问题描述
--kv-cache-dtype=int8 参数不生效,kv cache 完全没有被量化。运行 python examples/test_infer.py --model=<模型路径> --kv-cache-dtype=int8 后,输出与不传该参数完全一致,通过日志进行查看kv-cache-dtype为NONE。
环境:Linux + NVIDIA GPU(硬件平台),InfiniLM 0.1.0(软件环境)。排查发现 kv_cache_dtype 从 CLI 到 engine 的 Python 透传链路是断的:test_infer.py / LLM / EngineConfig / ModelRunner 均未传递该参数,flag 到 engine 前就被静默丢弃,C++ 侧收到 None,量化 scheme 保持 NONE,int8 路径完全不会执行。
如何复现
加载任意 llama 模型(如 TinyLlama-1.1B-Chat)
运行 python examples/test_infer.py --model=<模型路径> --kv-cache-dtype=int8
与不带 --kv-cache-dtype 的运行对比
观察输出完全一致,无任何量化发生
预期结果
开启后 kv cache 以 int8 存储(内存减半),量化路径被实际执行。