2023年13个最佳大型语言模型 (LLM)

- GPT-4
- GPT-3.5
- PaLM 2 (Bison-001)
- Claude v1
- Cohere
- Falcon
- LLaMA
- Guanaco-65B
- Vicuna 33B
- MPT-30B
- 30B-Lazarus
- WizardLM
- GPT4All
1. GPT-4
OpenAI 的 GPT-4 模型是 2023 年最好的人工智能大型语言模型(LLM)。GPT-4 模型于 2023 年 3 月发布,展示了复杂推理理解、高级编码能力、精通多种学术考试、展现人类水平的技能等巨大能力。 事实上,它是第一个可以接受文本和图像输入的多模态模型。虽然 ChatGPT 还没有加入多模态能力,但一些用户已经通过由 GPT-4 模型支持的必应聊天工具获得了这种能力。 除此以外,GPT-4 还是为数不多的能解决幻觉问题的 LLM 之一,并在事实性方面取得了长足进步。与 ChatGPT-3.5 相比,GPT-4 模型在多个类别的事实评估中得分接近 80%。为了使 GPT-4 模型更符合人类价值观,OpenAI 还付出了巨大努力,使用了人类反馈强化学习(RLHF)和通过领域专家进行的对抗测试。 GPT-4 模型已在超过 1 万亿个庞大参数的基础上进行了训练,并支持 32,768 个标记的最大上下文长度。到目前为止,我们对 GPT-4 的内部架构了解不多,但最近 The Tiny Corp 的 George Hotz 透露,GPT-4 是一个混合模型,有 8 个不同的模型,每个模型有 2200 亿个参数。基本上,它不是一个大的密集模型,正如之前所理解的那样。
2. GPT-3.5
继 GPT 4 之后,OpenAI 凭借 GPT-3.5 再次跃居第二。这是一款通用型 LLM,与 GPT-4 类似,但在特定领域缺乏专长。先说优点,它是一个速度惊人的模型,能在几秒钟内生成完整的响应。 无论是用 ChatGPT 完成写论文等创造性任务,还是用 ChatGPT 提出赚钱的商业计划,GPT-3.5 模型都能出色地完成。此外,该公司最近还为 GPT-3.5 涡轮增压型号发布了更大的 16K 上下文长度。别忘了,它还可以免费使用,而且没有小时或日限制。
3. PaLM 2 (Bison-001)
接下来是来自谷歌的 PaLM 2 人工智能模型,它被评为 2023 年最佳大型语言模型之一。在 PaLM 2 模型中,谷歌重点研究了常识推理、形式逻辑、数学和 20 多种语言的高级编码。据悉,最大的 PaLM 2 模型已经过 5400 亿个参数的训练,最大上下文长度为 4096 个词组。 谷歌已经发布了基于 PaLM 2 的四种不同大小的模型(Gecko、Otter、Bison 和 Unicorn)。其中,Bison 目前已经上市,它在 MT-Bench 测试中的得分是 6.40 分,而 GPT-4 则高达 8.99 分。
4. Claude v1
如果您不知道,Claude 是 Anthropic 开发的一款功能强大的 LLM,并得到了谷歌的支持。它由 OpenAI 的前员工共同创立,其目标是打造乐于助人、诚实无害的人工智能助手。在多项基准测试中,Anthropic 的 Claude v1 和 Claude Instant 模型都表现出了很好的前景。事实上,在 MMLU 和 MT-Bench 测试中,Claude v1 的表现优于 PaLM 2。
5. Cohere
Cohere 是一家人工智能初创公司,由曾在谷歌大脑团队工作的前谷歌员工创立。公司联合创始人之一艾丹-戈麦斯(Aidan Gomez)曾参与撰写 “注意力就是你所需要的一切”(Attention is all you Need)论文,该论文介绍了 Transformer 架构。与其他人工智能公司不同,Cohere 是为企业而来,为企业解决生成式人工智能用例。Cohere 有许多从小到大的模型–从只有 6B 参数的模型到 52B 参数训练的大型模型。
6. Falcon
Falcon 是本榜单中第一个开源大型语言模型,它的排名超过了迄今为止发布的所有开源模型,包括 LLaMA、StableLM、MPT 等。它由阿联酋技术创新研究所(TII)开发。Falcon 的最大优点是采用 Apache 2.0 许可开源,这意味着您可以将该模型用于商业目的。也没有版税或限制。
7. LLaMA
自从 LLaMA 模型在网上泄露后,Meta 公司就开始了开源之路。它正式发布了从 70 亿参数到 650 亿参数的各种规模的 LLaMA 模型。据 Meta 称,其 LLaMA-13B 模型优于 OpenAI 的 GPT-3 模型,后者是在 1750 亿个参数上训练出来的。许多开发人员正在使用 LLaMA 微调和创建一些最好的开源模型。尽管如此,请记住,LLaMA 仅用于研究,与 TII 的猎鹰模型不同,不能用于商业用途。
8. Guanaco-65B
在几个 LLaMA 衍生模型中,Guanaco-65B 被证明是最好的开源 LLM,仅次于 Falcon 模型。在 MMLU 测试中,它的得分是 52.7,而 Falcon 模型的得分是 54.1。同样,在 TruthfulQA 评估中,Guanaco 得分为 51.3,而 Falcon 则高出一筹,为 52.5。Guanaco 共有四种型号:7B、13B、33B 和 65B。所有模型都由 Tim Dettmers 和其他研究人员在 OASST1 数据集上进行了微调。
9. Vicuna 33B
Vicuna 是 LMSYS 开发的另一个功能强大的开源 LLM。与其他许多开源模型一样,它也是从 LLaMA 衍生而来。它通过监督指导进行了微调,训练数据收集自 sharegpt.com,这是一个用户分享其精彩 ChatGPT 对话的门户网站。它是一个自动回归的大型语言模型,经过 330 亿个参数的训练。
10. MPT-30B
MPT-30B 是另一个与 LLaMA 衍生模型竞争的开源 LLM。它由 Mosaic ML 开发,并在不同来源的大量数据语料库上进行了微调。它使用了 ShareGPT-Vicuna、Camel-AI、GPTeacher、Guanaco、Baize 和其他来源的数据集。这个开源模型最棒的地方在于它的上下文长度为 8K tokens。
11. 30B-Lazarus

12. WizardLM
WizardLM 是我们的下一个开源大型语言模型,它是为遵循复杂指令而构建的。一个人工智能研究团队提出了一种 Evol-instruct 方法,将初始指令集改写为更复杂的指令。生成的指令数据用于微调 LLaMA 模型。
13. GPT4All
GPT4ALL 是 Nomic AI 的一个项目。我推荐它不仅是因为它的内部模型,还因为它能让你在没有专用 GPU 或互联网连接的情况下在电脑上运行本地 LLM。它开发了一个 13B Snoozy 模型,效果相当不错。我在自己的电脑上测试过多次,鉴于我使用的是入门级电脑,它生成响应的速度相当快。我还在 GPT4All 上使用过 PrivateGPT,它确实能从自定义数据集中生成答案。
声明:本站所有文章,如无特殊说明或标注,均为本站作者原创发布。任何个人或组织,在未征得本站同意时,禁止复制、盗用、采集、发布本站内容到任何网站、书籍等各类媒体平台。本文来自作者自媒体,不代表UIED观点和立场。 如若本站内容侵犯了原著者的合法权益,可联系我们进行处理以减少您的损失。
标签






评论 0
最新评论登录后发布评论并参与互动。
暂无评论,欢迎抢沙发。