百度智能云生成式AI认证工程师考试题库
·
试卷核心说明
- 总分:100 分(80 分通过)
- 题量:50 题(含单选、多选、判断)
- 个人整理,不保证解析正确

- 制作一个 15 秒视频,按照 60 帧计算,生成图片的数量为( )。
- 选项:A. 300 B. 15 C. 60 D. 900
- 答案:D(900 张)
- 通俗完整解析:帧就是视频的 “静态画面切片”,就像翻动画书 —— 每一页是一帧,快速翻动就形成动态。60 帧 / 秒意味着 1 秒钟要连续播放 60 张图片(高清视频标准帧率)。计算逻辑超简单:总图片数 = 时长(秒)× 帧率(帧 / 秒)=15×60=900 张。易错点:别把 “60 帧” 误看成 “30 帧”(标清帧率),否则会算成 450 张(对应选项 A);实际用 AI 生成视频时,工具会自动按帧率算图片数,但理解这个逻辑能帮你调整流畅度。
- SFT 模型的数据规模通常需要多少条精标数据才能发挥良好的效果?( )
- 选项:A. 几万条 B. 上千条左右 C. 几十条 D. 几百万条
- 答案:B(上千条左右)
- 通俗完整解析:SFT 是 “监督微调”,相当于给大模型做 “专项技能培训”,精标数据就是 “带标准答案的练习题”。为什么选上千条?① 几十条(选项 C)太少:模型学不会稳定规律,比如只教 50 条客服话术,模型遇到新问题还是不会;② 几万条 / 几百万条(A、D)太多:标注成本高(人工标 10 万条要花很多钱和时间),性价比低。上千条是 “效果 + 成本平衡点”,比如训练客服模型,1000-5000 条精标对话就够适配日常咨询场景。
- 直接展示商品或服务,通过简单明了的宣传语、图片等吸引消费者。这种文案属于( )。
- 选项:A. 软文 B. 硬广 C. 公众号推文 D. 新闻稿
- 答案:B(硬广)
- 通俗完整解析:硬广就是 “不绕弯子的广告”,核心是 “直接说卖点”—— 比如超市货架上的商品海报写 “买一送一”、电视里的饮料广告说 “清爽解渴”,都是直白宣传。对比其他选项:软文(A)是 “间接种草”,比如写一篇 “夏天怎么防晒?我选 XX 防晒霜” 的文章,藏着广告;公众号推文(C)、新闻稿(D)可能含广告,但不是 “直接展示” 的核心类型。易错点:别把 “硬广” 和 “软文” 搞反,关键看是否 “直接宣传商品 / 服务”。
- 使用 ERNIE-Bot 4.0 的 chat 接口时,奇数位 message 的 role 值必须是什么?( )
- 选项:A. developer B. user 或 function C. assistant D. system
- 答案:B(user 或 function)
- 通俗完整解析:chat 接口的消息是 “一问一答” 的顺序,奇数位(第 1、3、5 条)必须是 “发起方”—— 要么是用户提问(user,比如 “帮我写文案”),要么是系统功能触发(function,比如自动调用知识库查询)。偶数位才是模型回应(assistant,选项 C)。打个比方:就像打电话,得先有人拨号(发起方),对方才能接(回应方)。易错点:别选 system(D),system 是设置全局参数(比如 “回答要简洁”),不是发起对话的 role 值。
- SFT 有哪些潜在益处?( )
- 选项:A. 提升任务特定性能 B. 防止过拟合 C. 解决数据稀缺性问题 D. 提高领域适应性
- 答案:A、D
- 通俗完整解析:SFT 的核心好处是 “让模型更懂特定任务 / 领域”。比如:给通用大模型做医疗 SFT,它就能更好地回答问诊问题(提升医疗任务性能 A,提高医疗领域适应性 D)。为什么 B、C 不对?① 防止过拟合(B):过拟合是模型 “学太死”(只会背题不会灵活用),SFT 解决不了,需要用 “正则化”“早停” 等方法;② 解决数据稀缺(C):SFT 反而需要足够的精标数据,数据少了还做不了,所以不能解决稀缺问题。易错点:别以为 SFT “啥都能解决”,记住它的核心是 “适配特定任务 / 领域”。
- 企业专属大模型的有监督精调阶段需要使用什么类型的数据?( )
- 选项:A. 海量的无标注的公开数据 B. 小规模的专业数据集 C. 高质量的有标注的企业内部数据 D. 随机抽样的数据集
- 答案:C(高质量的有标注的企业内部数据)
- 通俗完整解析:专属大模型是 “企业定制款”,比如银行的模型要懂房贷规则,就得用银行自己的内部数据(比如客户咨询记录、房贷业务文档)—— 这些数据是 “企业独有的”,外部公开数据(A)没有针对性。而且必须 “有标注”(比如给客户咨询记录标上 “问题类型:利率查询”“正确回复:XX 利率”),不然模型不知道学什么;“高质量” 是指数据准确、无错误,乱填的无效数据没用。易错点:别选 A(无标注公开数据),那是预训练阶段用的,精调专属模型必须用 “内部 + 有标注” 数据。
- 如果 prompt 过于笼统,大模型能够通过猜测用户的意图产生准确的回答。( )
- 选项:A. 正确 B. 错误
- 答案:B(错误)
- 通俗完整解析:prompt 是给模型的 “指令”,太笼统会让模型 “摸不着头脑”。比如只说 “写点东西”,模型不知道要写广告、作文还是通知;但说 “写 3 句手机促销文案,突出拍照功能”,才能精准回应。就像你跟朋友说 “帮我带点吃的”,朋友可能带零食、水果或饭菜,但说 “帮我带一份汉堡”,就不会出错。易错点:别以为模型 “能猜透心思”,笼统指令只会导致回答跑偏(比如写出来的文案不符合需求)。
- 文案优化和调整范围的内容是( )。
- 选项:A. 结合人类创造力 B. 优化和调整 C. 注意法律和道德问题 D. 提供指导
- 答案:A、B、C
- 通俗完整解析:文案优化不是 “一次性写好”,核心是 “让文案更好用、不违规”。① 结合人类创造力(A):AI 写的文案可能生硬,人要加灵感(比如给促销文案加网络热词);② 优化和调整(B):比如改措辞(“好用” 改成 “闭眼冲”)、调长度(适配短视频字幕);③ 注意法律和道德(C):不能写虚假宣传(比如 “包治百病”)、不侵犯他人权益(比如用别人的图片要授权)。为什么 D 不对?提供指导(D)是 “告诉别人怎么写”,不是 “优化文案本身” 的范围。易错点:别漏选 C,法律道德是底线,比如广告文案不能用 “最高级”(最棒、第一),否则违规。
- 模型评估支持范围包括以下哪些?( )
- 选项:A. 用户训练模型 B. 实时更新模型 C. 预置模型 D. 外部导入模型
- 答案:A、C
- 通俗完整解析:模型评估就是 “给模型打分”,支持的是 “自己训练的” 和 “平台自带的” 模型。① 用户训练模型(A):比如你用自己的数据训练了一个客服模型,能评估它的回答准确率;② 预置模型(C):平台自带的模型(比如 ERNIE-Bot 4.0),能评估它在特定任务上的表现。为什么 B、D 不对?① 实时更新模型(B):实时更新是 “模型一直在变”,评估需要固定版本,没法实时评;② 外部导入模型(D):外部模型(比如你从其他平台下载的模型),平台没法获取它的参数,不能评估。易错点:别选 B,实时更新和评估是两回事,评估是针对 “固定版本” 的模型。
- AI 视频相比传统视频的优势的有( )。
- 选项:A. 优质的服务 B. 更低的成本 C. 更高的质量 D. 更快的创作速度
- 答案:B、D
- 通俗完整解析:AI 视频的核心优势是 “省时间、省钱”。① 更快的创作速度(D):传统视频要拍素材、剪片子,可能要几天;AI 视频输入文字就能生成(比如 “生成 15 秒美食视频,展示做菜过程”),几分钟搞定;② 更低的成本(B):不用租设备、雇摄影师,AI 工具可能免费或低价就能用。为什么 A、C 不对?① 优质服务(A):服务好不好看平台,不是 AI 视频本身的优势;② 更高质量(C):AI 视频质量可能不如专业拍摄(比如画面细节、构图),只是 “够用”,不是 “更优”。易错点:别以为 AI 视频 “质量更好”,它的优势是效率和成本,不是画质。
- 在选择通用大模型作为行业大模型基座时,需要考虑哪些因素?( )
- 选项:A. 模型的预训练数据范围和质量 B. 模型的规模 C. 模型的开放性 D. 模型在自然语言处理任务上的性能
- 答案:A、B、D
- 通俗完整解析:通用大模型当 “基座”,就是要 “底子好”,能支撑行业定制。① 预训练数据(A):数据范围广(比如涵盖医疗、金融)、质量高(无错误),后续行业微调才容易;② 模型规模(B):规模越大(参数越多),学习能力越强,比如千亿参数模型比百万参数模型更能适配复杂行业场景;③ NLP 性能(D):行业大模型常做文本任务(比如客服对话、文档分析),NLP 性能好(比如理解准确、生成流畅)才好用。为什么 C 不对?开放性(C)是指模型是否开源(能看代码),不是核心 —— 就算不开源,只要性能好、数据全,也能当基座。易错点:别选 C,开放性不是选择基座的关键因素,重点看 “数据、规模、性能”。
- RAG 模型出现的背景是为了解决大型语言模型的哪项局限性?( )
- 选项:A. 知识的局限性 B. 计算效率 C. 模型的大小 D. 生成能力
- 答案:A(知识的局限性)
- 通俗完整解析:大模型的知识库是 “固定的”,比如 2023 年训练的模型不知道 2024 年的新消息,也不懂某企业内部的专属知识(比如公司新出的制度)—— 这就是知识局限性。RAG 就像给模型装了个 “实时搜索引擎”:用户提问后,RAG 先从外部知识库(比如企业文档、最新新闻)找相关信息,再让模型结合这些信息回答,解决 “知识过时、知识不全” 的问题。其他选项:计算效率(B)是模型跑得多快,模型大小(C)是参数多少,生成能力(D)是模型能不能写文案、做图片,都不是 RAG 要解决的核心问题。易错点:别选 D,RAG 不提升生成能力,只提升生成内容的 “准确性(知识正确)”。
- 文心一言生成图像的方式有( )。
- 选项:A. 通过一言百宝箱绘图 B. 使用图像生成图像 C. 直接使用提示词编写绘图 D. 使用标签方式绘图
- 答案:A、C
- 通俗完整解析:文心一言生成图片就两种核心方式:① 百宝箱绘图(A):打开文心一言的 “百宝箱”,找到绘图工具,选风格(比如卡通、写实)就能生成;② 提示词编写(C):直接输入文字描述(比如 “蓝色天空下的白色小房子,水彩风格”),模型按文字画图。为什么 B、D 不对?① 图像生成图像(B):文心一言不能用一张图生成另一张图(比如上传一张猫的图,让它生成狗的图),这是其他 AI 工具(比如 Stable Diffusion)的功能;② 标签方式(D):不能只选标签(比如只选 “房子”“蓝色”)生成,必须有完整的文字描述。易错点:别选 B,文心一言不支持 “图生图”,只支持 “文生图”。
- 推荐系统中常见的召回方式有( )。
- 选项:A. 协同召回 B. 热销召回 C. 标签召回 D. 时间召回
- 答案:A、B、C
- 通俗完整解析:召回是推荐系统的 “第一步”,就是 “从海量商品里挑出可能符合用户需求的一批”。① 协同召回(A):看 “相似用户 / 商品”,比如 “买了 A 商品的人还买了 B”,就给买 A 的人推荐 B;② 热销召回(B):推荐卖得好的商品(比如 “销量 TOP10”);③ 标签召回(C):按用户 / 商品标签匹配,比如用户喜欢 “运动” 标签,就推荐带 “运动” 标签的商品。为什么 D 不对?时间召回(D)是 “按时间推荐”(比如只推今天上架的商品),不是主流方式,很少单独用。易错点:别漏选 A,协同召回是推荐系统最常用的召回方式之一。
- 关于 SFT 数据的描述,下列哪些是正确的?( )
- 选项:A. 数据不需要精标 B. 数据格式包括 Jsonl 格式 C. 数据必须是排序类 D. 数据要求信息无害
- 答案:B、D
- 通俗完整解析:SFT 数据是 “给模型训练的练习题”,有明确要求:① 格式支持 Jsonl(B):Jsonl 是常用的批量数据格式,每条数据是一个 Json 对象(比如 {"question":"怎么贷款?","answer":"XX 流程"}),方便模型读取;② 信息无害(D):不能有违法、暴力、虚假数据(比如教别人诈骗的内容),否则模型会学坏。为什么 A、C 不对?① 数据需要精标(A 错误):SFT 是监督微调,必须有准确标注(比如问题 + 正确答案),没标注的 data 没用;② 数据不一定是排序类(C 错误):SFT 数据可以是对话、文案、问答等,不一定需要按顺序排列。易错点:别选 A,SFT 数据的核心要求之一就是 “精标”,没标注等于白给模型看。
- 论文为了保证前后文一致性,使用提示工程时需要使用什么方式处理提示词( )。
- 选项:A. Few-shot B. 思考法 C. 戴高帽 D. 索引法
- 答案:A(Few-shot)
- 通俗完整解析:Few-shot 就是 “给模型看示例”,让它照着示例保持一致。比如写论文时,想让模型一直用 “用户需求→解决方案→效果验证” 的结构,就可以在提示词里给 1-2 个示例:“示例 1:用户需求是提升客服效率→解决方案是训练 AI 客服→效果验证是咨询响应时间缩短 50%;请按此结构写后续内容”。模型就会跟着示例的结构和表述风格来,保证前后一致。其他选项:思考法(B)是让模型 “一步步想”,戴高帽(C)是 “夸模型专业”,索引法(D)是 “加引用标注”,都不能保证前后文一致性。易错点:别选 C,戴高帽只会让模型更自信,不会让它保持结构 / 表述一致。
- 在自动裁判员打分系统中,打分模板(Prompt)可以自定义设置的变量包括以下哪些?( )
- 选项:A. 裁判员模型的调用次数和计费方式 B. 裁判员模型的名称和版本号 C. 打分指标(metric)和评分步骤(steps) D. 打分模板的样式和字体大小
- 答案:C(打分指标和评分步骤)
- 通俗完整解析:自定义打分模板,就是 “告诉系统怎么打分、看哪些维度”。① 打分指标(metric):比如评估文案好坏,指标可以是 “吸引力、准确性、合规性”;② 评分步骤(steps):比如 “第一步看是否符合主题,第二步看是否有违规词,第三步给总分”。其他选项都是 “系统层面的设置”,不是模板变量:A(调用次数 / 计费)是平台计费规则,B(模型名称 / 版本)是选哪个模型打分,D(样式 / 字体)是显示问题,都不能在打分模板里自定义。易错点:别选 D,模板是 “打分的逻辑”,不是 “显示的样式”,字体大小和打分没关系。
- AIGC 文案进行文本分析优势明显,一般可以用于哪些场景( )。
- 选项:A. 童话故事 B. 广告文案 C. 论文阅读 D. 通告编写
- 答案:B(广告文案)
- 通俗完整解析:AIGC 文案的文本分析优势是 “快速抓卖点、适配营销场景”。比如分析竞品广告文案的关键词(比如 “性价比”“高颜值”),生成自己的广告文案;或者分析用户评论,提炼用户关心的点(比如 “用户觉得手机续航好”),用到广告里。其他场景:童话故事(A)是创作,不是分析;论文阅读(C)需要深度理解学术内容,AIGC 的分析不够精准;通告编写(D)是格式化写作,不需要复杂分析。易错点:别选 A,AIGC 能写童话故事,但题干问的是 “文本分析优势”,不是创作优势。
- 不具有 AI 幻觉处理功能的方法是( )。
- 选项:A. 戴高帽 B. 思考法 C. 追溯法 D. 索引法
- 答案:A(戴高帽)
- 通俗完整解析:AI 幻觉就是模型 “瞎编不存在的信息”(比如编造一个不存在的论文、虚假数据)。① 思考法(B):让模型 “一步步说思路”,比如 “你说这个数据来自 XX 报告,那报告的发布时间是什么?”,模型编不出来就会暴露;② 追溯法(C):让模型提供信息来源(比如 “引用 XX 官网 2024 年数据”),没来源就是幻觉;③ 索引法(D):让模型从指定知识库找信息(比如 “只能用公司内部文档回答”),避免瞎编。而戴高帽(A)是 “夸模型专业”(比如 “你是专家,一定要准确”),不仅没用,还可能让模型更自信地瞎编,完全不能处理幻觉。易错点:别选 B,思考法是抑制幻觉的有效方法,核心是 “让模型自证信息正确性”。
- 在 Agent Builder 工具中,哪个工具能与文心一格结合,生成对应的图像?( )
- 选项:A. 知识问答 - 知识库检索 B. 代码解释器 C. 文生图 D. 知识问答 - 百度搜索
- 答案:C(文生图)
- 通俗完整解析:文心一格是百度的 AI 绘画工具,Agent Builder 里的 “文生图组件” 就是专门对接它的 —— 在工具里添加 “文生图” 组件,输入文字描述(比如 “粉色樱花树,二次元风格”),组件会自动调用文心一格的能力,生成对应的图片。其他选项:知识库检索(A)是查文档,代码解释器(B)是运行代码,百度搜索(D)是查网页,都和生成图像没关系。易错点:别选 B,代码解释器不能生成图片,只能处理数据(比如算报表、画图表)。
- GBI 系统中,若用户 15 天未使用应用,会发生什么情况?( )
- 选项:A. 系统会自动更新 B. 数据文件会保持不变 C. 已上传的数据会被清空 D. 对话历史会自动保存
- 答案:C(已上传的数据会被清空)
- 通俗完整解析:GBI 是百度智能云的应用搭建工具,为了节省服务器存储空间,有 “闲置清理规则”:如果一个应用 15 天没人用,之前上传的数据集(比如 Excel 表格、文本文件)会自动清空,避免占用不必要的资源。其他选项:系统自动更新(A)是平台的事,和用户用不用应用没关系;数据保持不变(B)、对话历史保存(D)都不符合清理规则,闲置太久会被清。易错点:别选 B,要记住 GBI 的闲置数据清理规则,15 天未用→数据清空。
- 生成式人工智能伦理原则包含( )。
- 选项:A. 尊重知识产权、商业道德 B. 尊重人类尊严和权利 C. 防止伤害他人身心健康 D. 保护个人隐私和数据安全
- 答案:A、B、C、D
- 通俗完整解析:生成式 AI 的伦理原则就是 “不害人、守规矩”。① 尊重知识产权(A):不能盗用别人的文案、图片(比如 AI 生成的图片不能抄版权作品);② 尊重人类尊严(B):不能生成歧视性内容(比如歧视性别、地域);③ 防止伤害(C):不能生成暴力、自杀指导等有害内容;④ 保护隐私(D):不能泄露用户的个人信息(比如把用户输入的手机号、住址生成到文案里)。这四项都是核心原则,缺一不可。易错点:别漏选任何一项,伦理原则是全方位的,既包括法律层面(知识产权、隐私),也包括道德层面(尊严、不伤害)。
- RAG 框架的核心理念是什么?( )
- 选项:A. 检索 B. 检索 + 生成 C. 生成 D. 存储
- 答案:B(检索 + 生成)
- 通俗完整解析:RAG 的核心是 “先找再写”,分两步:① 检索(Retrieval):用户提问后,先从外部知识库(比如企业文档、最新新闻)里找相关的准确信息(比如用户问 “公司 2024 年年假规则”,就从公司制度文档里找规则);② 生成(Generation):把找到的信息和大模型自己的知识结合,用通顺的语言回复用户。如果只检索(A),只能返回文档片段,不能生成自然语言回答;只生成(C),模型可能瞎编(比如不知道新规则)。打个比方:RAG 就像 “学生考试”,先查课本(检索),再结合自己的理解写答案(生成)。易错点:别选 A 或 C,RAG 是 “检索 + 生成” 的结合,缺一不可。
- 在 Prompt Engineering 中,为了改善大模型对 prompt 的理解和回答质量,我们应该怎么做?( )
- 选项:A. 尝试不同的表达方式 B. 只使用一个标准的 prompt C. 限制模型的功能 D. 提供不相关的信息
- 答案:A(尝试不同的表达方式)
- 通俗完整解析:提示工程就是 “优化指令”,模型对不同措辞的理解可能不一样。比如想让模型写促销文案,第一次说 “写点手机的促销话”,回答可能一般;换个表达 “写 3 句手机促销文案,突出 5000 万像素和超长续航,语气活泼,适合短视频”,回答会更精准。其他选项:只⽤一个 prompt(B)会错过更好的表达;限制功能(C)会让模型没法发挥;提供无关信息(D)会干扰模型理解(比如写手机文案,却提电脑的卖点)。易错点:别选 B,不要固执于一种 prompt 写法,多试几种结构、措辞,能找到模型最容易理解的方式。
- 在通用大模型的构建流程中,预训练阶段通常使用的数据是什么类型的?( )
- 选项:A. 音频数据 B. 图像数据 C. 无标注的文本数据 D. 有标注的文本数据
- 答案:C(无标注的文本数据)
- 通俗完整解析:预训练是大模型的 “基础学习阶段”,就像小孩学说话 —— 听海量的对话(不用有人教 “这句话是什么意思”),自然学会语言规律、常识。这个阶段用的是 “无标注文本数据”(比如网上的文章、书籍、新闻),数量要足够多(几十亿、几百亿字),模型从数据里自己总结规律(比如 “太阳从东方升起” 是常识,“的、地、得” 的用法)。其他选项:音频(A)、图像(B)是多模态模型的预训练数据,但题干问的是 “通用大模型”(核心是文本能力);有标注数据(D)是精调阶段用的,预训练不用标注(标注成本太高)。易错点:别选 D,预训练用无标注数据,精调才用有标注数据,这是大模型构建的核心区别。
- 在 Prompt Tuning 中,需要训练更新的是什么?( )
- 选项:A. 无需更新任何参数 B. 额外引入的 prompt embeddings 参数 C. 预训练大模型的主体参数 D. 预训练大模型的全部参数
- 答案:B(额外引入的 prompt embeddings 参数)
- 通俗完整解析:Prompt Tuning 是 “轻量微调”,核心是 “不改变大模型本身”。大模型的主体参数(比如千亿级参数)太多,更新起来又费时间又费钱,所以 Prompt Tuning 只加一个 “小参数模块”(prompt embeddings),相当于给大模型加一个 “专属指令模板”。比如想让模型适配医疗场景,就训练一个医疗相关的 prompt embeddings,模型不用改核心参数,就能听懂医疗指令。其他选项:不更新参数(A)没法适配场景;更新主体 / 全部参数(C、D)是 “全量微调”,不是 Prompt Tuning。易错点:别选 C,Prompt Tuning 的关键是 “轻量”,只训练额外的小参数,不是大模型的核心参数。
- 通用大模型相较于专业化模型有哪些不足?( )
- 选项:A. 应用范围窄 B. 训练数据缺乏多样性 C. 对涉密信息比专业化模型效果更好 D. 在细分领域专业性不如专业模型
- 答案:D(在细分领域专业性不如专业模型)
- 通俗完整解析:通用大模型是 “通才”,什么都懂一点(比如能聊天、写文案、算数学),但在细分领域(比如医疗诊断、法律条文解读)不如 “专才”—— 专业化模型是用某一领域的专属数据训练的,比如医疗模型懂各种病症、药物,回答会更精准;而通用模型可能会说外行话(比如把感冒说成肺炎)。其他选项:通用模型应用范围广(A 错误);训练数据多样性强(B 错误);涉密信息处理(C)和 “通用 / 专业” 无关,看数据是否涉密。易错点:别选 C,涉密信息处理是数据安全问题,不是模型类型的不足。
- 不是生成式人工智能优势的选项是( )。
- 选项:A. 可以为企业降本增效 B. 使用过程无需人员参与 C. 更高的创作效率 D. 生成内容多样
- 答案:B(使用过程无需人员参与)
- 通俗完整解析:生成式 AI 的优势是 “快、省、多”——① 降本增效(A):比如 AI 写文案不用雇专职文案,省成本;② 创作效率高(C):几分钟生成几十条文案,比人写快;③ 内容多样(D):能生成不同风格(比如活泼、正式)的内容。但它不能 “无人参与”(B):比如要写广告文案,得有人告诉模型 “目标客户是年轻人”“突出性价比”;生成后还得有人审核(比如有没有违规词),它是 “辅助工具”,不是 “全自动机器”。易错点:别选 A,降本增效是生成式 AI 的核心优势之一,而 “无需人员参与” 是常见误区。
- 提示注入攻击包含( )。
- 选项:A. 越狱攻击 B. 目标劫持 C. 间接提示注入 D. 提示泄露
- 答案:A、B、C
- 通俗完整解析:提示注入攻击是 “通过恶意提示,让模型做不该做的事”。① 越狱攻击(A):绕过模型的安全规则(比如让模型生成暴力内容,原本模型会拒绝);② 目标劫持(B):让模型偏离原本的任务(比如模型是客服,却被诱导生成广告);③ 间接提示注入(C):通过间接方式注入恶意提示(比如在文档里藏恶意指令,让模型读取文档后执行)。为什么 D 不对?提示泄露(D)是 “模型泄露了用户的提示词”,不是 “攻击模型”,属于信息泄露,不是注入攻击。易错点:别选 D,区分 “注入攻击”(主动攻击模型)和 “提示泄露”(被动泄露信息)。
- 在人工智能模型开发中,通常用于训练模型的数据集是什么?( )
- 选项:A. 评估数据集 B. 验证集 C. 测试集 D. 训练集
- 答案:D(训练集)
- 通俗完整解析:模型开发有三个核心数据集,分工明确:① 训练集(D):给模型 “上课” 的资料,比如大量标好答案的文本(“问题:1+1=? 答案:2”),模型从这里学习规律;② 验证集(B):“小测验” 资料,训练过程中用,判断模型学得好不好(比如调整参数);③ 测试集(C):“期末考试” 资料,最后检验模型的最终效果;④ 评估数据集(A)是统称,不是具体用于训练的数据集。打个比方:训练集是课本,验证集是作业,测试集是考试卷,模型靠课本(训练集)学知识。易错点:别选 B 或 C,验证集和测试集是用来评估的,不是训练的。
- 大型语言模型写代码的主要用途包括哪些方面?( )
- 选项:A. 编写单元测试 B. 代码注释和文档编写 C. 代码编写与优化 D. 代码审查辅助
- 答案:A、B、C、D
- 通俗完整解析:大模型写代码就是 “程序员的辅助工具”,覆盖全流程:① 编写单元测试(A):写完核心代码后,模型能自动生成测试代码(比如验证函数是否正确);② 注释和文档(B):给代码加注释(比如 “这个函数是计算总和”),或生成使用文档(比如 “如何调用这个接口”);③ 代码编写与优化(C):根据需求写代码片段(比如 “用 Python 写一个读取 Excel 的函数”),或优化现有代码(比如让代码运行更快);④ 代码审查辅助(D):找出代码里的错误(比如语法错误、逻辑漏洞),给出修改建议。这四项都是常见用途,能帮程序员节省时间。易错点:别漏选 A,单元测试是代码开发的重要环节,大模型在这方面的辅助作用很明显。
- LoRA 模型训练过程中不包含的步骤是( )。
- 选项:A. 数据集准备 B. 模型测试 C. 自定义模型结构 D. 模型训练
- 答案:C(自定义模型结构)
- 通俗完整解析:LoRA 是 “轻量微调” 技术,核心是 “不改变原模型结构”—— 原模型是个复杂的 “大房子”,LoRA 不用拆了重建,只在房子里加几个 “小零件”(低秩矩阵),就能让模型适配特定任务。训练步骤包括:① 数据集准备(A):准备精标数据;② 模型训练(D):训练加进去的 “小零件”;③ 模型测试(B):检验训练效果。唯一不用做的是自定义模型结构(C),如果改结构,就不是 LoRA 了,而是 “重写模型”。易错点:别选 B,模型测试是任何训练过程都有的步骤,LoRA 也不例外,核心区别是 “不改模型结构”。
- 专属大模型通常基于什么数据进行训练?( )
- 选项:A. 企业或组织的内部数据 B. 问卷调查数据数据 C. 随机抽样的数据集 D. 行业通用的数据
- 答案:A(企业或组织的内部数据)
- 通俗完整解析:专属大模型是 “为某家企业 / 组织量身定制” 的,比如银行的专属模型要懂自己的房贷规则、客户信息,医院的专属模型要懂自己的病历数据、诊疗规范 —— 这些都是 “内部数据”,外部数据(比如行业通用数据 D、随机抽样数据 C)没有针对性。问卷调查数据(B)可能是内部数据的一部分,但不是核心,核心是 “企业独有的、适配自身业务的数据”。易错点:别选 D,行业通用数据是训练通用行业模型的,专属模型必须用 “自己的内部数据”,才能体现 “专属”。
- 提示词:“今天天气不错可是没带雨伞,只好呆在家里。” 的语病是( )。
- 选项:A. 歧义 B. 前后矛盾 C. 语序不当 D. 成分残缺
- 答案:B(前后矛盾)
- 通俗完整解析:这句话的逻辑说不通 ——“天气不错” 通常意味着没雨(不用带雨伞),但后半句说 “没带雨伞只好呆在家里”,暗示有雨,前后意思冲突。其他选项:歧义(A)是一句话有多种意思(比如 “咬死了猎人的狗”,分不清是狗死了还是猎人死了);语序不当(C)是词语顺序错了(比如 “我吃饭在早上”);成分残缺(D)是缺少主语 / 谓语(比如 “在公园玩”,缺少主语 “我”)。易错点:别选 A,这句话没有多种意思,只是逻辑矛盾。
- AppBuilder-SDK 提供的开发组件不包括以下哪一项?( )
- 选项:A. 大模型组件 B. 第三方接口组件 C. AI 能力组件 D. 基础云组件
- 答案:D(基础云组件)
- 通俗完整解析:AppBuilder-SDK 是 “搭建智能应用的工具包”,提供的都是和 “AI 能力、大模型” 相关的组件:① 大模型组件(A):比如调用 ERNIE-Bot 的组件;② 第三方接口组件(B):比如对接微信、支付宝的接口;③ AI 能力组件(C):比如文生图、文档解析组件。基础云组件(D)是百度智能云的 “基础服务”(比如服务器、存储、数据库),不是 SDK 里的开发组件 ——SDK 是用来搭应用的 “功能模块”,基础云组件是 “运行应用的环境”。易错点:别选 B,第三方接口组件是 SDK 的一部分,比如搭建一个智能客服应用,可能需要对接企业的 CRM 系统(第三方接口)。
- RLHF 阶段的训练目的是什么?( )
- 选项:A. 使模型能够处理更多的语言种类 B. 奖励大模型生成人类更加认可的表达 C. 提高模型处理大数据的能力 D. 减少模型的训练时间
- 答案:B(奖励大模型生成人类更加认可的表达)
- 通俗完整解析:RLHF 是 “基于人类反馈的强化学习”,核心是 “让模型说的话更符合人类习惯”。步骤很简单:① 让模型生成多个回答;② 人类给这些回答打分(比如 A 回答比 B 回答更自然、更有用);③ 模型根据打分调整,下次优先生成高分风格的回答。比如模型原本回答 “我认为这个方案可行”,人类觉得太生硬,打分低;模型调整后回答 “这个方案挺靠谱的”,人类打分高,以后就会用更口语化的表达。其他选项:处理多语言(A)是预训练 / 精调的事;处理大数据(C)是模型架构的事;减少训练时间(D)和 RLHF 无关,RLHF 反而会增加一点训练步骤。易错点:别选 A,RLHF 不提升语言种类能力,只提升 “人类认可度”。
- 在选择 Post-pretrain 语料时,应考虑哪些方面的数据质量?( )
- 选项:A. 数据的原创性 B. 语义高质量 C. 数据的实时性 D. 内容高质量
- 答案:B、C、D
- 通俗完整解析:Post-pretrain 是 “预训练之后的二次预训练”,目的是让模型更懂特定领域(比如金融、医疗),所以语料质量要满足 “适配领域、准确、新鲜”。① 语义高质量(B):语言通顺、逻辑清晰(比如医疗语料不能有 “感冒要吃抗生素” 这种错误逻辑);② 实时性(C):数据要新(比如金融语料用 2024 年的政策,不用 2010 年的),避免模型学过时的知识;③ 内容高质量(D):信息准确、无错误(比如法律语料要和现行法律一致)。为什么 A 不对?原创性(A)不是核心 —— 只要数据准确、适配领域,哪怕是引用的(比如引用金融时报的文章)也能用,不用必须原创。易错点:别选 A,Post-pretrain 看重 “数据是否适配领域、是否准确新鲜”,不是是否原创。
- Post-pretrain 阶段有哪些潜在的益处?( )
- 选项:A. 减少训练时间 B. 降低误解的风险 C. 提高模型性能 D. 提升领域专业性
- 答案:C、D
- 通俗完整解析:Post-pretrain 是 “给预训练模型补领域知识”,好处很直接:① 提高模型性能(C):比如原本通用模型回答金融问题准确率 60%,Post-pretrain 后提升到 85%;② 提升领域专业性(D):模型能懂领域术语(比如金融的 “ETF”“市盈率”),不会说外行话。为什么 A、B 不对?① 减少训练时间(A):Post-pretrain 需要额外训练,会增加时间,不是减少;② 降低误解风险(B):误解是模型没理解用户意图,和领域知识无关,需要优化 prompt,不是 Post-pretrain。易错点:别选 A,Post-pretrain 是 “额外训练”,会增加时间,核心益处是 “性能 + 专业性”。
- 提示词理解正确的是( )。
- 选项:A. 提示词可以引导大模型生成所需的文本、图像或其他内容。 B. 提示词内容越简短越好 C. 提示词内容越复杂越好 D. 提示词只适用于文生文的场景中
- 答案:A
- 通俗完整解析:提示词是 “给模型的指令”,核心作用是 “引导模型生成想要的内容”—— 既可以让模型写文本(比如文案、论文),也可以生成图像(比如 “画一只猫”)、音频(比如 “生成一段轻音乐”),支持多模态。其他选项:① 越简短越好(B):太短会笼统(比如 “写文案” 不如 “写 3 句手机促销文案”);② 越复杂越好(C):太复杂会冗余(比如写文案加一堆无关要求);③ 只适用于文生文(D):错误,提示词支持文生图、文生音等多场景。易错点:别选 B 或 C,提示词的关键是 “简洁明了、信息完整”,不是越短或越长越好。
- 在自动裁判员打分系统中,若要对被评估模型进行评分,需要进行的步骤可能包括哪些?( )
- 选项:A. 选择合适的裁判员模型 B. 修改打分模板(Prompt)的语言(由汉语改为英语) C. 输入评分模板至裁判员模型 D. 设定合理的打分指标
- 答案:A、C、D
- 通俗完整解析:给模型打分的核心步骤是 “选对工具、定好规则、输入指令”。① 选择裁判员模型(A):比如评估中文文案,选懂中文的模型,不能选只懂英文的;② 设定打分指标(D):比如评估文案好坏,指标是 “吸引力、准确性、合规性”;③ 输入评分模板(C):把指标和评分步骤写成模板(比如 “第一步看是否合规,违规得 0 分”),告诉裁判员模型怎么评。为什么 B 不对?修改语言(B)没必要,只要打分模板和被评估模型的输出语言一致就行(比如被评估模型输出中文文案,模板用中文),不用特意改英语。易错点:别选 B,语言修改不是必要步骤,核心是 “打分规则和指标”。
- 使用到序列模型的应用有( )。
- 选项:A. 视频动作识别 B. 机器翻译 C. 音乐生成 D. 情感分类
- 答案:B、C、D
- 通俗完整解析:序列模型是 “处理有序数据” 的模型,比如文本是 “字的序列”、音乐是 “音符的序列”。① 机器翻译(B):把中文句子(字的序列)翻译成英文句子(字的序列),需要按顺序处理;② 音乐生成(C):按顺序生成音符,形成连贯的音乐;③ 情感分类(D):分析句子的情感(比如 “我很开心” 是积极),需要按顺序理解词语的关系。为什么 A 不对?视频动作识别(A)是处理图像序列(帧的序列),属于计算机视觉(CV)领域,不用序列模型,用 CNN、Transformer 等模型。易错点:别选 A,序列模型主要用于自然语言处理(NLP)和音频领域,不是视频动作识别。
- ( )属于无效提示词。
- 选项:A. “你能告诉我关于世界的事情吗?” B. “请为一名即将毕业的会计学大学生撰写一封求职信” C. “请绘制一张猫的图片,使用二次元风格” D. “北京最好的特色餐厅有哪些?”
- 答案:A
- 通俗完整解析:无效提示词的核心是 “过于宽泛,模型不知道怎么回应”。选项 A “关于世界的事情” 太广了 —— 世界的历史、地理、文化?模型没法给出具体答案。其他选项都指令明确:B 有明确对象(会计学毕业生)和任务(写求职信);C 有明确内容(猫的图片)和风格(二次元);D 有明确地点(北京)和需求(最好的特色餐厅)。易错点:别选 D,“北京最好的特色餐厅” 虽然 “最好” 没有统一标准,但模型能推荐热门餐厅,指令是明确的,不是无效提示词。
- AI 能力组件中,可以用于文档内容解析,并支持解析出版式、位置坐标、表格结构等内容的组件是什么?( )
- 选项:A. 文档解析 B. 文档切分 C. 语义匹配 D. 语义向量计算
- 答案:A(文档解析)
- 通俗完整解析:文档解析组件的核心功能是 “把文档拆成结构化信息”,比如上传一份 PDF 文档,它能识别出:① 版式(比如标题、正文、图片的位置);② 位置坐标(比如某段文字在页面的 X/Y 坐标);③ 表格结构(比如表格的行数、列数、单元格内容),还能提取文本、图片等信息。其他选项:文档切分(B)是把文档分成小块(比如按章节分),不解析结构;语义匹配(C)是找相似文本;语义向量计算(D)是把文本转换成向量,都和 “解析版式、表格结构” 无关。易错点:别选 B,文档切分只负责 “拆分”,不负责 “解析结构”。
- Post-pretrain 过程中,关于领域专业性数据的正确描述是什么?( )
- 选项:A. 专注于广泛主题而非专业性内容 B. 包含领域内常见的专业术语和词汇 C. 仅包含通用词汇 D. 包含领域内罕见的专业术语和词汇
- 答案:B(包含领域内常见的专业术语和词汇)
- 通俗完整解析:Post-pretrain 是 “给模型补领域知识”,数据必须 “有领域特色”—— 比如金融领域的 Post-pretrain 数据,要包含 “ETF、市盈率、涨停” 等常见专业术语;医疗领域的要包含 “挂号、处方药、CT 检查” 等词汇。其他选项:① 广泛主题(A):错误,要专注领域内主题,不是广泛主题;② 仅含通用词汇(C):错误,通用词汇(比如 “的、是、在”)没有领域特色,学不到专业知识;③ 罕见术语(D):错误,罕见术语(比如金融领域的冷门监管术语)用不上,还会让模型学偏。易错点:别选 D,Post-pretrain 要学 “常见术语”,不是 “罕见术语”,核心是 “实用的领域知识”。
- Stable Diffusion 使用的模型是( )。
- 选项:A. GAN B. 扩散模型 C. Transformer D. BERT
- 答案:B(扩散模型)
- 通俗完整解析:Stable Diffusion 是知名的 AI 绘画工具,它的核心模型是 “扩散模型(Diffusion Model)”。扩散模型的原理很简单:先把一张图片变成随机噪音,再一步步还原成清晰图片,通过这个过程学习 “如何从文字生成图片”。其他选项:GAN(A)是另一种生成模型(比如生成人脸的 StyleGAN),不是 Stable Diffusion 用的;Transformer(C)是大模型的核心架构(比如 GPT、BERT);BERT(D)是 NLP 领域的模型,用于文本理解,和绘画无关。易错点:别选 A,GAN 和扩散模型是两种不同的生成模型,Stable Diffusion 明确用的是扩散模型。
- 在大模型组件中,用于将复杂问题拆解为简单问题的组件是什么?( )
- 选项:A. Query 改写 B. 复杂 Query 判定 C. 阅读理解问答 D. 复杂 Query 分解
- 答案:D(复杂 Query 分解)
- 通俗完整解析:复杂 Query 就是 “一句话包含多个问题”,比如 “北京的天气怎么样?哪里有特色餐厅?”,这个组件会把它拆成两个简单问题:“北京的天气怎么样?” 和 “北京哪里有特色餐厅?”,再让模型分别回答,最后汇总结果。其他选项:Query 改写(A)是把问题改得更通顺(比如 “北京天气?” 改成 “北京今天的天气怎么样?”);复杂 Query 判定(B)是判断一个问题是不是复杂问题;阅读理解问答(C)是根据文档回答问题,都不负责 “拆解问题”。易错点:别选 A,Query 改写是 “优化问题表述”,不是 “拆解问题”。
- 百度云千帆 AppBuilder 提供的应用组件包括哪些?( )
- 选项:A. 对话 B. 创作 C. 表格问答 D. 文档问答
- 答案:A、C、D
- 通俗完整解析:AppBuilder 的核心组件是 “适配不同场景的 AI 能力”:① 对话组件(A):搭建智能客服、聊天机器人;② 表格问答组件(C):上传 Excel 表格,让用户通过提问获取表格数据(比如 “2024 年 3 月的销售额是多少?”);③ 文档问答组件(D):上传 PDF、Word 文档,让用户提问获取文档内容(比如 “文档里的产品价格是多少?”)。为什么 B 不对?创作(B)是一个 “功能场景”,不是独立组件 —— 创作文案可以用 “对话组件 + 提示词” 实现,没有专门的 “创作组件”。易错点:别选 B,要区分 “组件” 和 “功能场景”,AppBuilder 的组件是具体的工具模块,不是宽泛的功能。
- 当前生成式人工智能常见的数据安全问题不包含( )。
- 选项:A. 模型黑盒化 B. 算法复杂 C. 用户数据大量泄露 D. 可靠性差
- 答案:B(算法复杂)
- 通俗完整解析:数据安全问题是 “和数据相关的风险”,比如数据泄露、模型滥用等。① 模型黑盒化(A):模型的决策过程不透明,可能泄露训练数据里的敏感信息(比如用户手机号);② 用户数据泄露(C):训练模型的用户数据被非法获取;③ 可靠性差(D):模型生成错误数据(比如虚假的用户信息),造成安全风险。而算法复杂(B)是模型的技术特性,和 “安全” 无关 —— 算法再复杂,只要防护得当,也不会有安全问题;算法简单,防护不好也会有安全风险。易错点:别选 A,模型黑盒化可能导致数据泄露,属于安全问题,而算法复杂不是。
- GBI 的数据上传功能有哪些限制?( )
- 选项:A. 支持多种编码格式 B. 文件大小不超过 10MB C. 文件内容不超过 40 列和 1 万行 D. 可以上传任意数量的文件
- 答案:B、C
- 通俗完整解析:GBI 上传数据有明确的 “大小和内容限制”,避免资源占用过多:① 文件大小≤10MB(B):比如上传 Excel 表格,不能超过 10MB,太大的文件需要拆分;② 内容≤40 列 / 1 万行(C):表格最多 40 列、1 万行,超过会上传失败。为什么 A、D 不是限制?① 支持多种编码格式(A):是 GBI 的优势,不是限制(比如支持 UTF-8、GBK 编码);② 任意数量文件(D):GBI 没有明确限制文件数量,只要单个文件符合大小和内容要求就行。易错点:别选 A,A 是支持的功能,不是限制,核心限制是 “大小和行列数”。
- 在 RAG 系统中,最后产生回答的过程包含哪些输入的组合?( )
- 选项:A. 用户查询生成的向量与知识库中的文档向量 B. 用户原始查询与选中的信息片段 C. 相似度评分与提示词 D. 用户查询与向量数据库
- 答案:B(用户原始查询与选中的信息片段)
- 通俗完整解析:RAG 生成回答的最后一步是 “整合信息”,输入有两个:① 用户原始查询(比如 “公司 2024 年年假规则”):明确用户的需求;② 选中的信息片段(比如从公司制度文档里检索到的 “年假天数按工龄计算,满 1 年 5 天”):精准的知识来源。模型把这两个输入结合,用通顺的语言生成回答(比如 “根据公司 2024 年制度,年假天数按工龄计算,满 1 年可休 5 天”)。其他选项:A 是 “检索阶段” 的输入(计算相似度),不是最后生成回答的输入;C、D 和生成回答的核心输入无关。易错点:别选 A,A 是检索时用的,最后生成回答需要的是 “原始查询 + 检索到的信息片段”,不是向量。
更多推荐


所有评论(0)