Qwen3.6-35B-A3B-NVFP4 nvidia
- 種別
- model
- タスク
- text-generation
- フレームワーク
- Model Optimizer
- ダウンロード
- 12,119,552
- いいね
- 553
- アクセス
- public
- ファイル
- 0
タグ
- テキスト生成
- 量子化
- 大規模言語モデル
- MoEアーキテクチャ
- 多言語
- ローカルデプロイ
- vLLM
- 推論デプロイ
概要
NVIDIAがModel OptimizerでQwen3.6-35B-A3B(MoE・Hybrid Attention、総35B・活性3B)をNVFP4量子化したモデルです。パラメータ当たり16bit→4bit化でディスク・GPUメモリを約3.06倍削減し、vLLMによる高速推論を実現します。チャットボット、Agentシステム、RAGなどの配備用途に最適で、最大262Kの長文脈コンテキストとマルチモーダル入力をサポートします。
README
--- pipeline_tag: text-generation base_model: - Qwen/Qwen3.6-35B-A3B license: apache-2.0 library_name: Model Optimizer tags: - nvidia - ModelOpt - Qwen3.6 - quantized - FP4 - fp4 --- # Model Overview ## 説明: NVIDIA Qwen3.6-35B-A3B-NVFP4 モデルは、最適化されたトランスフォーマーアーキテクチャを採用した自己回帰言語モデルである Alibaba の Qwen3.6-…