TeleChat是由中电信人工智能科技有限公司研发训练的大语言模型。TeleChat的核心在于其强大的对话能力和丰富的中英文语料库支持,分为TeleChat-7B和TeleChat-12B两大版本,分别使用了1.5万亿和3万亿Tokens的高质量中英文语料进行训练。

一、TeleChat是什么?

TeleChat是一个大语言模型框架,提供了丰富的对话功能,适用于多种自然语言处理任务。TeleChat-7B和TeleChat-12B模型基座分别使用了1.5万亿和3万亿Tokens的高质量中英文语料进行训练,涵盖了书籍、百科、新闻、政务、法律、医药、专利、论文、数学、代码等各个领域的数据。相比TeleChat-7B,TeleChat-12B在通用问答、知识类、代码类、数学类等方面有大幅提升。

模型结构改进:
  • 词嵌入层与输出层解耦:将词嵌入层和输出lm head层参数分开,增强训练稳定性和收敛性。
训练数据优化:
  • 高质量语料:涵盖广泛领域的数据,确保模型在多种任务中的优异表现。
  • 数据清洗:优化数据清洗策略,提高数据的文本干净度、观点无偏性、内容有效性和格式规范性。
训练方法改进:
  • 科学数据配比学习:使用小参数模型在多种数据配比的数据上拟合,得到对各个数据集难度的先验估计。
  • 动态权重调整:训练过程中动态提升较难学习的数据集权重,保证模型在各个数据集上的优异表现。

二、TeleChat的网站地址

  1. Github仓库TeleChat Github
  2. Gitee仓库TeleChat Gitee
  3. 论文地址TeleChat 论文

三、TeleChat的模型特色

  • 大规模语料训练:采用1.5万亿Tokens的中英文高质量语料进行训练。
  • 长文生成能力:在工作总结、工作计划、PPT大纲、申论、招标书、邮件、方案、周报、JD写作等长文写作任务上表现优异。
  • 模型量化版本:开源了7B和12B模型的int8和int4量化版本。
  • 先进的训练方法:科学数据配比学习与课程学习方法,确保模型在各个数据集上的优异表现。

TeleChat不仅提供了强大的对话能力,还在长文生成、知识类问答、代码生成等方面有出色的表现。通过开源对话模型TeleChat-7B-bot和TeleChat-12B-bot,以及其huggingface格式的权重文件,用户可以轻松访问和使用这些先进的语言模型。

TeleChat 官网

访问 TeleChat GitHubTeleChat Gitee 了解更多关于这款强大的大语言模型的信息。