大语言模型(large language model,LLM)第一节
·
目录
第一部分:理解语言模型
大语言模型(large language model,LLM)
“人工智能”(AI )这个术语通常用于描述致力于执行接近人类智能任务(如语音识别、语
言翻译和视觉感知)的计算机系统。它是指软件产生的智能,而不是人类的智能。
以下是 AI 学科创始人之一 John McCarthy 给出的更正式的定义:
(人工智能)是制造智能机器,特别是智能计算机程序的科学和工程。它与使用
计算机理解人类智能的任务相似,但人工智能不必局限于生物学上可观察到的那
些方法。 —— John McCarthy , 2007
NPC ( nonplayable character,非玩家角色)
自然语言处理 ( natural language processing , NLP )
语言人工智能 是人工智能的一个子领域,专注于开发能够理解、处理和生成人类语言的技
术。
语言人工智能历史始于一种名为 词袋(bag-of-words) 的技术,这是一种表示非结构化文本
的方法 2 。它早在 20 世纪 50 年代就被提出,但直到 2000 年前后才开始流行。
词袋模型的工作原理如下。假设我们有两个句子需要创建数值表示。词袋模型的第一步是
分词 ( tokenization ),即将句子拆分成单个词或子词( 词元 , token ),
词袋虽然是一种优雅的方法,但存在一个明显的缺陷。它仅仅把语言视为一个几乎字面意
义上的“词袋”,而忽略了文本的语义特性和含义。
word2vec(词向量) 于 2013 年发布,是首批成功利用 嵌入(embedding) 这个概念来捕捉
文本含义的技术之一 3 。嵌入是数据的向量表示,试图捕捉数据的含义。为此, word2vec 通
过在大量文本数据(如整个维基百科)上训练来学习词的语义表示。
为了生成这些语义表示, word2vec 利用了 神经网络(neural network )技术。神经网络由处
理信息的多层互连节点组成。如图 1-6 所示,神经网络可以有多个“层”,每个连接都有一
定的权重,这些权重通常被称为模型的 参数 。
更多推荐

所有评论(0)