Qwen3.6-35B-A3B-NVFP4 nvidia

種別
model
タスク
text-generation
フレームワーク
Model Optimizer
ダウンロード
12,119,552
いいね
553
アクセス
public
ファイル
0

タグ

  • テキスト生成
  • 量子化
  • 大規模言語モデル
  • MoEアーキテクチャ
  • 多言語
  • ローカルデプロイ
  • vLLM
  • 推論デプロイ

概要

NVIDIAがModel OptimizerでQwen3.6-35B-A3B(MoE・Hybrid Attention、総35B・活性3B)をNVFP4量子化したモデルです。パラメータ当たり16bit→4bit化でディスク・GPUメモリを約3.06倍削減し、vLLMによる高速推論を実現します。チャットボット、Agentシステム、RAGなどの配備用途に最適で、最大262Kの長文脈コンテキストとマルチモーダル入力をサポートします。

README

--- pipeline_tag: text-generation base_model: - Qwen/Qwen3.6-35B-A3B license: apache-2.0 library_name: Model Optimizer tags: - nvidia - ModelOpt - Qwen3.6 - quantized - FP4 - fp4 --- # Model Overview ## 説明: NVIDIA Qwen3.6-35B-A3B-NVFP4 モデルは、最適化されたトランスフォーマーアーキテクチャを採用した自己回帰言語モデルである Alibaba の Qwen3.6-…

查看完整页面 · 查看原文