AI Agent 技术在汽车智驾平台中的应用与底层 Infra 技术栈全景
AI Agent 技术在汽车智驾平台中的应用与底层 Infra 技术栈全景
本文档汇总了关于“AI Agent 技术岗位要求”、“汽车智驾平台 Agent 落地场景”、“端云协同推理”、“车端部署与实时通信”、“AI Agent vs AI Infra 岗位区别”以及“核心模型概念”等全部讨论内容,面向校招选手和底层系统方向求职者。
注:本文由AI辅助生成
目录
- AI Agent 技术岗位通用要求
- 汽车智驾平台中的 Agent 落地场景
- 端云协同:大模型要不要部署到车端?
- 端云协同推理所需技术栈
- 车领域 Agent 岗位侧重点:搭建 vs 部署 vs 通信 vs 路由
- AI Agent 岗位 vs AI Infra 岗位的本质区别
- 核心工具链详解:TensorRT 与 vLLM
- 国产化平台:昇腾 NPU / AIC 工具链
- 核心概念:端侧模型 vs 多模态模型
- 底层智驾 Infra 技术栈蓝图(总览)
1. AI Agent 技术岗位通用要求
核心定位
从“训练模型”转向“构建系统” —— 把大模型作为大脑,通过工程手段让其自主调用工具、记忆信息,稳定可靠地完成复杂任务。
硬技能
- 编程与框架:精通 Python,熟悉至少一门后端语言;熟练使用 LangChain、LlamaIndex、AutoGen 等 Agent 框架。
- 核心技术:精通 Prompt 工程(CoT/ReAct 等),有 RAG 系统(含向量数据库)端到端开发经验,熟悉 Function Calling 与工具调用。
- 工程基础:扎实的算法与数据结构,熟悉异步编程、分布式调度及 Redis/MQ 等中间件;Docker/K8s 是加分项。
软素质
- 系统思维:全局视角设计可扩展、高可用系统,关注“任务成功率”。
- 调试韧性:能应对模型“不听话”,通过调优 Prompt 或工具描述解决问题。
- Owner 意识:主动定义问题、推动协作,对业务效果负责。
- 学习能力:快速跟进每周迭代的 LLM 新技术。
校招准备建议
- 项目为王:做一个端到端的 RAG+Agent 项目(如“自动查 API 写周报的助手”),突出多跳推理、工具调用冲突解决、结果校验。
- 面试高频:LeetCode 中等难度、Prompt 工程实操(Few-shot/结构化输出)、RAG 深挖(Chunking/混合检索)、分布式基础(异步队列/超时熔断)。
- 加分项:开源贡献(LangChain/Dify)、独立技术博客。
2. 汽车智驾平台中的 Agent 落地场景
① 智能座舱(最直接、最成熟)
- 多模态交互:通过摄像头感知驾驶员表情/动作,自动执行指令(如抱物时自动开尾门)。
- 复杂意图理解:Agent 自主拆解“去太湖兜风 + 点歌 + 订餐厅”等复合任务,跨功能编排。
- 技术切入点:Prompt 工程、多模态大模型调用、工具(API)编排。
② 自动驾驶决策(前沿方向)
- 复杂场景推理:LLM + 思维链(CoT)处理无信号灯路口、匝道汇入等长尾场景。
- 端到端运动规划:多模态大模型(MLLM)理解鸟瞰图(BEV)和路网信息,生成可执行规划代码。
- 技术切入点:VLA(视觉语言动作模型)、端到端大模型。
③ 多车协同与车路云一体化
- 多车协同决策:多 Agent 系统通过 LLM 协商或无信号灯路口达成共识,避免拥堵。
- 云控平台:全局 Agent 实现超视距感知和协同控制,测试效率提升超 200%。
- 技术切入点:系统设计、异步通信、分布式调度。
④ 底层架构与生态
- 舱驾一体:一个“AI 大脑”打通座舱和智驾域。
- AI 推理芯片:如蔚来神玑芯片已有专门针对 Agent 推理场景的产品序列。
3. 端云协同:大模型要不要部署到车端?
答案:不是全部部署,量产方案是“端云协同”——部分放车端,部分放云端。
🚗 必须放车端(强实时、高安全)
- 场景:语音唤醒、AEB 视觉感知、驾驶员疲劳监测(DMS)。
- 模型:蒸馏/量化后的小参数模型(0.5B~3B),配合 VLA 的视觉编码器。
- 芯片:车规级芯片(如 Orin)跑这些任务。
- 技术点:模型轻量化(量化、剪枝)。
☁️ 必须放云端(非实时、超复杂)
- 场景:复杂闲聊、多车协同全局规划、海量数据挖掘(影子模式)。
- 模型:满血版大模型(如 GPT-4o 级别),在云端 GPU 集群运行。
- 技术点:高并发 API 调度、异步任务队列。
⚖️ 混合部署(体现架构能力)
- 实时感知(端侧):摄像头识别障碍物,车端小模型即时反应。
- 复杂推理(云侧):云端大模型理解“前方修路”,重新规划路线推送车机。
- 端云协同推理:车端推理失败或置信度低时,自动请求云端协助。
面试加分话术
“我会根据任务的 SLA(服务等级协议)来划分 —— 时延 < 100ms 的走端侧 Pipeline;时延 > 500ms 且需要常识的,走云端 Agent。”
4. 端云协同推理所需技术栈
① 端侧轻量化引擎(车端部署)
- 推理框架:TensorRT(NVIDIA)、ONNX Runtime、TFLite。
- 模型压缩:NNCF、PyTorch Pruning,掌握 QAT(量化感知训练)。
- 端侧 Agent 框架:ROS 2、CyberRT(百度 Apollo)。
② 云端大模型集群(云端大脑)
- 推理加速:vLLM(PagedAttention)、TensorRT-LLM。
- Agent 编排:LangChain / LlamaIndex(任务拆解)、DSPy(自动化提示优化)。
- 异步队列:Celery + Redis(削峰)、Kafka(海量数据回传)。
③ 实时通信“数据管道”
- 通信协议:MQTT over WebSocket(弱网强项)、gRPC(高实时双向流)。
- 序列化:Protobuf(比 JSON 小且快);视频流用 H.264/H.265 硬编解码。
- 策略:智能超时与重传(指数退避)、请求合并(Batching)。
④ 智能路由决策层
- 置信度打分:端侧模型输出置信度低于阈值(如 0.7)时触发云端请求。
- 工具:Ray 动态调度,或自建轻量级规则引擎。
校招项目示例
“基于 vLLM 搭建云端服务,车端用 TensorRT 部署 MiniCPM,通过 MQTT 通信。信号弱时本地规则兜底,正常时利用置信度打分动态决定是否上云。”
5. 车领域 Agent 岗位侧重点:搭建 vs 部署 vs 通信 vs 路由
| 方向 | 核心关注点 | 技术重点 |
|---|---|---|
| Agent 搭建 | 任务拆解、Prompt 调优、工具调用 | LangChain、ReAct、多 Agent 协作 |
| 车端部署 | 模型量化、推理加速、显存优化 | TensorRT、ATC、C++/CUDA |
| 实时通信 | 弱网保活、低延迟、零拷贝 | MQTT/gRPC、CyberRT/ROS 2、共享内存 |
| 智能路由 | 置信度判断、端云切换、安全兜底 | 系统设计、SLA 分级、Fail-safe |
结论:对于底层智驾岗位,“车端部署 + 实时通信 + 智能路由”是核心护城河,Agent 搭建是基本功(默认必须会)。
6. AI Agent 岗位 vs AI Infra 岗位的本质区别
| 维度 | AI Agent 工程师(应用层) | AI Infra 工程师(系统层) |
|---|---|---|
| 核心指标 | 任务成功率、准确率 | 延迟(Latency)、吞吐(QPS)、显存占用 |
| 日常工具 | LangChain、Prompt 模板、向量数据库 | TensorRT、vLLM、CUDA、ROS 2/CyberRT |
| 优化对象 | 模型调用的流程和策略 | 模型推理的速度和资源消耗 |
| 典型难题 | “Agent 拆解任务错了,怎么改 Prompt?” | “Orin 芯片显存爆了,怎么把模型塞进去?” |
| 车端职责 | 定义“云端规划”和“本地规则”的调用逻辑 | 保证规划结果在 < 50ms 内到达控制单元 |
一句话总结:AI Agent 是“用模型”,AI Infra 是“供模型”。
底层智驾岗位 = AI Infra 方向,竞争壁垒在于让系统在极限物理条件下稳定运行。
7. 核心工具链详解:TensorRT 与 vLLM
🚀 TensorRT
- 定位:NVIDIA 专有 GPU 推理优化器,将模型编译为高度优化的“机器码”。
- 核心技术:算子融合、层剪枝、FP16/INT8 量化。
- 场景:车端/端侧,单次推理必须快(< 50ms)。
- 校招话术:
“我用 TensorRT 部署 ONNX 模型,通过 INT8 量化和层间融合,将推理从 80ms 优化到 25ms。遇到精度掉点,通过部分层保留 FP32 解决。”
⚡ vLLM
- 定位:专为 Transformer 大模型设计的高吞吐推理引擎。
- 核心技术:PagedAttention(将 KV Cache 分页管理,类似 OS 内存管理)。
- 场景:云端部署,支撑海量并发请求。
- 校招话术:
“vLLM 的 PagedAttention 解决了传统显存利用率低的问题,吞吐量提升数倍,适合云端大模型服务。”
8. 国产化平台:昇腾 NPU / AIC 工具链
| 层级 | 工具 | 对标 NVIDIA |
|---|---|---|
| 底层架构 | CANN(异构计算架构) | CUDA |
| 模型优化(大模型) | vLLM-Ascend(官方插件) | vLLM |
| 模型优化(小模型) | MindIE-RT / ATC(转 OM 格式) | TensorRT |
| 服务化部署 | Triton + torch_npu / MindIE-Service | Triton / TensorRT-LLM |
校招建议:做一个“在昇腾开发者套件上用 ATC 工具将 ResNet50 转为 OM 模型,并用 Triton 服务化部署”的项目,直接命中国产化替代痛点。
9. 核心概念:端侧模型 vs 多模态模型
| 维度 | 端侧模型 | 多模态模型 |
|---|---|---|
| 分类标准 | 部署位置(本地 vs 云端) | 输入数据类型(单模态 vs 多模态) |
| 关注点 | 体积小、功耗低、速度快 | 能看懂图片、听懂声音 |
| 代表模型 | MobileNet、TinyBERT、Phi-3 | CLIP、Flamingo、GPT-4V、BEVFormer |
| 在车里 | 部署在 Orin/地平线芯片上的模型 | 融合摄像头和雷达数据的模型 |
面试必考题:“怎么把多模态模型部署到端侧?”
- 答:蒸馏到 3B 以下 → INT8 量化 → 异构计算(NPU + CPU 异步流水线)。
10. 底层智驾 Infra 技术栈蓝图(总览)
更多推荐

所有评论(0)