Qwen3.6-35B-A3B-NVFP4 nvidia
- 类型
- model
- 任务
- text-generation
- 框架
- Model Optimizer
- 下载量
- 12,119,552
- 点赞
- 553
- 访问
- public
- 文件
- 0
标签
- 文本生成
- 大语言模型
- 混合专家
- 量化
- 多模态
- Agent
- 推理部署
- transformers
摘要
这是NVIDIA使用Model Optimizer对阿里Qwen3.6-35B-A3B混合专家(MoE)模型进行NVFP4量化后的版本,总参数量35B、激活3B,支持最长262K上下文。量化后磁盘与显存占用降低约3.06倍,可通过vLLM在Hopper/Blackwell等GPU上高效推理。适用于AI Agent、聊天机器人、RAG系统及其他AI应用的预量化即用部署场景。
README
--- pipeline_tag: text-generation base_model: - Qwen/Qwen3.6-35B-A3B license: apache-2.0 library_name: Model Optimizer tags: - nvidia - ModelOpt - Qwen3.6 - quantized - FP4 - fp4 --- # Model Overview ## 描述: NVIDIA Qwen3.6-35B-A3B-NVFP4 模型是阿里巴巴 Qwen3.6-35B-A3B 模型的量化版本,后者是一种使用优化 Transformer 架构的自回归语言模…