Qwen3.6-35B-A3B-NVFP4 nvidia

类型
model
任务
text-generation
框架
Model Optimizer
下载量
12,119,552
点赞
553
访问
public
文件
0

标签

  • 文本生成
  • 大语言模型
  • 混合专家
  • 量化
  • 多模态
  • Agent
  • 推理部署
  • transformers

摘要

这是NVIDIA使用Model Optimizer对阿里Qwen3.6-35B-A3B混合专家(MoE)模型进行NVFP4量化后的版本,总参数量35B、激活3B,支持最长262K上下文。量化后磁盘与显存占用降低约3.06倍,可通过vLLM在Hopper/Blackwell等GPU上高效推理。适用于AI Agent、聊天机器人、RAG系统及其他AI应用的预量化即用部署场景。

README

--- pipeline_tag: text-generation base_model: - Qwen/Qwen3.6-35B-A3B license: apache-2.0 library_name: Model Optimizer tags: - nvidia - ModelOpt - Qwen3.6 - quantized - FP4 - fp4 --- # Model Overview ## 描述: NVIDIA Qwen3.6-35B-A3B-NVFP4 模型是阿里巴巴 Qwen3.6-35B-A3B 模型的量化版本,后者是一种使用优化 Transformer 架构的自回归语言模…

查看完整页面 · 查看原文