MNBVC liwu

MNBVC: Massive Never-ending BT Vast Chinese corpus

種別
dataset
ライセンス
mit
言語
zh
ダウンロード
103,490
いいね
650
アクセス
public
ファイル
0

タグ

  • 事前学習コーパス
  • 大規模データセット
  • 多言語
  • テキストデータ
  • コードデータ
  • 言語モデリング
  • 日本語コーパス

概要

MNBVCは継続的に更新される巨大な中国語インターネットコーパスデータセットです。学術論文、ブログ、書籍、コード、クローラー、フォーラム、ゲーム対話など多種多様なサブセットで構成されています。大規模言語モデルの事前学習や言語モデリング、マスク言語モデリングの訓練に適しており、streaming形式で効率的にロード可能です。

README

--- annotations_creators: - other language: - zh language_creators: - other license: - mit multilinguality: - monolingual pretty_name: MNBVC size_categories: - unknown source_datasets: - original task_categories: - text-generation - fill-mask task_ids: - language-modeling - masked-language-modeling…

查看完整页面 · 查看原文