Skip to content

Latest commit

 

History

History
103 lines (77 loc) · 8.64 KB

File metadata and controls

103 lines (77 loc) · 8.64 KB

modelslim_v1 配置说明

1. 配置概述

modelslim_v1 量化任务配置,位于 YAML 根节点。

项目 内容
配置类 ModelslimV1QuantConfig
源码 quant_config.py

2. 参数列表

2.1 ModelslimV1QuantConfig

字段路径 类型 必选/可选 默认值 取值范围或格式 含义 引用配置
apiversion string 可选 Unknown(代码占位;YAML 中须按任务类型显式指定) modelslim_v1、multimodal_vlm_modelslim_v1、multimodal_sd_modelslim_v1、modelslim_convert API 版本(任务类型),决定 spec 的结构:modelslim_v1、multimodal_vlm_modelslim_v1、multimodal_sd_modelslim_v1、modelslim_convert;YAML 中必须显式指定,默认值 Unknown 仅为代码内部占位,不可直接使用。 无
spec object 必选 无 — modelslim_v1 服务的 spec 结构,声明量化流水线、保存格式与校准数据。 本页 §2.2

配置约束

  • 无。

2.2 ModelslimV1ServiceConfig

modelslim_v1 服务的 spec 结构,声明量化流水线、保存格式与校准数据。

字段路径 类型 必选/可选 默认值 取值范围或格式 含义 引用配置
runner string 可选 auto auto、model_wise、layer_wise、dp_layer_wise 流水线执行方式:auto 按设备数量自动选择(单设备 layer_wise,多设备 dp_layer_wise)、model_wise 整模型计算、layer_wise 逐层计算、dp_layer_wise 数据并行逐层计算。 无
prior list[object] 可选 [] — 前置阶段列表,每阶段含 process 与 dataset 本页 §2.3
process list[object] 可选 [] — 量化处理器链,按顺序执行;每个元素是 type 分派的处理器配置,如 linear_quant、awq、smooth_quant 等。 本页 §2.4
save list[object] 可选 [] — 保存格式列表,每个元素是 type 分派的保存格式配置,如 ascendv1_saver、compressed_tensors、mindie_format_saver。 本页 §2.5
dataset string 可选 mix_calib.jsonl — 校准数据集名称(lab_calib 下的文件名)或数据集路径,用于量化的参数估计与敏感性校准。 无

配置约束

  • 无。

2.3 PriorStageConfig

前置阶段配置:仅 process + dataset,用于如 adapt_rotation stage1 等先验阶段。

字段路径 类型 必选/可选 默认值 取值范围或格式 含义 引用配置
process list[object] 可选 [] — 该阶段处理器列表 本页 §2.4
dataset string / null 可选 null — 该阶段数据集名称,不提供则使用 spec.dataset 无

配置约束

  • 无。

2.4 AutoProcessorConfig

派生类

  • AdaptRotationProcessorConfig(type: adapt_rotation) — 自适应旋转(adapt_rotation)处理器配置。 《adapt_rotation 配置说明》
  • AutoroundProcessorConfig(type: autoround_quant) — autoround 量化处理器配置。 《autoround_quant 配置说明》
  • AWQProcessorConfig(type: awq) — AWQ(Activation-aware Weight Quantization)处理器配置。 《awq 配置说明》
  • BinaryAnalysisProcessorConfig(type: binary_analysis) — 二值(有/无量化)敏感度分析处理器配置。 《binary_analysis 配置说明》
  • BinaryOperatorLayerWiseProcessorConfig(type: binary_operator_layer_wise) — 逐层敏感度分析处理器配置(对比逐块浮点与量化输出)。 《binary_operator_layer_wise 配置说明》
  • BinaryOperatorModelWiseProcessorConfig(type: binary_operator_model_wise) — 模型级敏感度分析配置(对比模型最终输出,使用 MSE 指标) 《binary_operator_model_wise 配置说明》
  • DynamicCacheProcessorConfig(type: dynamic_cache) — KV cache 量化处理器配置。 《dynamic_cache 配置说明》
  • FA3QuantProcessorConfig(type: fa3_quant) — FA3(FlashAttention-3)量化处理器配置。 《fa3_quant 配置说明》
  • FlatQuantProcessorConfig(type: flatquant) — FlatQuant处理器配置:定义量化训练参数、策略、混合精度等 《flatquant 配置说明》
  • FlexAWQSSZProcessorConfig(type: flex_awq_ssz) — FlexAWQSSZ 平滑+AWQ 处理器配置。 《flex_awq_ssz 配置说明》
  • FlexSmoothQuantProcessorConfig(type: flex_smooth_quant) — FlexSmoothQuant 平滑量化处理器配置。 《flex_smooth_quant 配置说明》
  • FloatSparseProcessorConfig(type: float_sparse) — 浮点稀疏处理器配置。 《float_sparse 配置说明》
  • GroupProcessorConfig(type: group) — 处理器合并器配置。 《group 配置说明》
  • IterSmoothProcessorConfig(type: iter_smooth) — 迭代平滑(IterativeSmooth)处理器配置。 《iter_smooth 配置说明》
  • KVSmoothProcessorConfig(type: kv_smooth) — KV cache 平滑处理器配置。 《kv_smooth 配置说明》
  • LinearProcessorConfig(type: linear_quant) — 线性层(Linear)量化处理器配置。 《linear_quant 配置说明》
  • LoadProcessorConfig(type: load) — 模块加载/卸载处理器配置。 《load 配置说明》
  • OASQProcessorConfig(type: oasq) — OASQ(Outlier-Aware Smooth Quantization)处理器配置。 《oasq 配置说明》
  • OnlineQuaRotProcessorConfig(type: online_quarot) — 在线 QuaRot 旋转处理器配置。 《online_quarot 配置说明》
  • QuaRotProcessorConfig(type: quarot) — QuaRot(离线旋转)处理器配置。 《quarot 配置说明》
  • QuantSaveProcessorConfig(type: saver) — 统一保存处理器配置。 《saver 配置说明》
  • SmoothQuantProcessorConfig(type: smooth_quant) — SmoothQuant 平滑量化处理器配置。 《smooth_quant 配置说明》
  • SVDResidualProcessorConfig(type: svd_res) — SVD 残差(低秩补偿)处理器配置。 《svd_res 配置说明》
  • TrainableLinearQuantProcessorConfig(type: trainable_linear_quant) — 可训练线性量化(TLQ)处理器配置。 《trainable_linear_quant 配置说明》
  • UnaryAnalysisProcessorConfig(type: unary_analysis) — 一元(无量化)敏感度分析处理器配置。 《unary_analysis 配置说明》

2.5 QuantFormatConfig

派生类

  • AscendV1QuantFormatConfig(type: ascendv1_saver) — AscendV1 保存格式配置,导出昇腾落盘格式的权重文件。 《ascendv1_saver 配置说明》
  • CompressedTensorsQuantFormatConfig(type: compressed_tensors) — compressed_tensors 保存格式配置,导出 safetensors 权重与 config.json。 《compressed_tensors 配置说明》
  • MindIEQuantFormatConfig(type: mindie_format_saver) — MindIE 保存格式配置,导出 MindIE 落盘格式的权重文件。 《mindie_format_saver 配置说明》

3. 完整配置参考

apiversion: modelslim_v1
spec:
  runner: auto
  prior: []
  process: []
  save: []
  dataset: mix_calib.jsonl