AI Agent 技术在汽车智驾平台中的应用与底层 Infra 技术栈全景

本文档汇总了关于“AI Agent 技术岗位要求”、“汽车智驾平台 Agent 落地场景”、“端云协同推理”、“车端部署与实时通信”、“AI Agent vs AI Infra 岗位区别”以及“核心模型概念”等全部讨论内容,面向校招选手和底层系统方向求职者。


注:本文由AI辅助生成

目录

  1. AI Agent 技术岗位通用要求
  2. 汽车智驾平台中的 Agent 落地场景
  3. 端云协同:大模型要不要部署到车端?
  4. 端云协同推理所需技术栈
  5. 车领域 Agent 岗位侧重点:搭建 vs 部署 vs 通信 vs 路由
  6. AI Agent 岗位 vs AI Infra 岗位的本质区别
  7. 核心工具链详解:TensorRT 与 vLLM
  8. 国产化平台:昇腾 NPU / AIC 工具链
  9. 核心概念:端侧模型 vs 多模态模型
  10. 底层智驾 Infra 技术栈蓝图(总览)

1. AI Agent 技术岗位通用要求

核心定位

从“训练模型”转向“构建系统” —— 把大模型作为大脑,通过工程手段让其自主调用工具、记忆信息,稳定可靠地完成复杂任务。

硬技能

  • 编程与框架:精通 Python,熟悉至少一门后端语言;熟练使用 LangChain、LlamaIndex、AutoGen 等 Agent 框架。
  • 核心技术:精通 Prompt 工程(CoT/ReAct 等),有 RAG 系统(含向量数据库)端到端开发经验,熟悉 Function Calling 与工具调用。
  • 工程基础:扎实的算法与数据结构,熟悉异步编程、分布式调度及 Redis/MQ 等中间件;Docker/K8s 是加分项。

软素质

  • 系统思维:全局视角设计可扩展、高可用系统,关注“任务成功率”。
  • 调试韧性:能应对模型“不听话”,通过调优 Prompt 或工具描述解决问题。
  • Owner 意识:主动定义问题、推动协作,对业务效果负责。
  • 学习能力:快速跟进每周迭代的 LLM 新技术。

校招准备建议

  • 项目为王:做一个端到端的 RAG+Agent 项目(如“自动查 API 写周报的助手”),突出多跳推理、工具调用冲突解决、结果校验。
  • 面试高频:LeetCode 中等难度、Prompt 工程实操(Few-shot/结构化输出)、RAG 深挖(Chunking/混合检索)、分布式基础(异步队列/超时熔断)。
  • 加分项:开源贡献(LangChain/Dify)、独立技术博客。

2. 汽车智驾平台中的 Agent 落地场景

① 智能座舱(最直接、最成熟)

  • 多模态交互:通过摄像头感知驾驶员表情/动作,自动执行指令(如抱物时自动开尾门)。
  • 复杂意图理解:Agent 自主拆解“去太湖兜风 + 点歌 + 订餐厅”等复合任务,跨功能编排。
  • 技术切入点:Prompt 工程、多模态大模型调用、工具(API)编排。

② 自动驾驶决策(前沿方向)

  • 复杂场景推理:LLM + 思维链(CoT)处理无信号灯路口、匝道汇入等长尾场景。
  • 端到端运动规划:多模态大模型(MLLM)理解鸟瞰图(BEV)和路网信息,生成可执行规划代码。
  • 技术切入点:VLA(视觉语言动作模型)、端到端大模型。

③ 多车协同与车路云一体化

  • 多车协同决策:多 Agent 系统通过 LLM 协商或无信号灯路口达成共识,避免拥堵。
  • 云控平台:全局 Agent 实现超视距感知和协同控制,测试效率提升超 200%。
  • 技术切入点:系统设计、异步通信、分布式调度。

④ 底层架构与生态

  • 舱驾一体:一个“AI 大脑”打通座舱和智驾域。
  • AI 推理芯片:如蔚来神玑芯片已有专门针对 Agent 推理场景的产品序列。

3. 端云协同:大模型要不要部署到车端?

答案:不是全部部署,量产方案是“端云协同”——部分放车端,部分放云端。

🚗 必须放车端(强实时、高安全)

  • 场景:语音唤醒、AEB 视觉感知、驾驶员疲劳监测(DMS)。
  • 模型:蒸馏/量化后的小参数模型(0.5B~3B),配合 VLA 的视觉编码器。
  • 芯片:车规级芯片(如 Orin)跑这些任务。
  • 技术点:模型轻量化(量化、剪枝)。

☁️ 必须放云端(非实时、超复杂)

  • 场景:复杂闲聊、多车协同全局规划、海量数据挖掘(影子模式)。
  • 模型:满血版大模型(如 GPT-4o 级别),在云端 GPU 集群运行。
  • 技术点:高并发 API 调度、异步任务队列。

⚖️ 混合部署(体现架构能力)

  • 实时感知(端侧):摄像头识别障碍物,车端小模型即时反应。
  • 复杂推理(云侧):云端大模型理解“前方修路”,重新规划路线推送车机。
  • 端云协同推理:车端推理失败或置信度低时,自动请求云端协助。

面试加分话术

“我会根据任务的 SLA(服务等级协议)来划分 —— 时延 < 100ms 的走端侧 Pipeline;时延 > 500ms 且需要常识的,走云端 Agent。”


4. 端云协同推理所需技术栈

① 端侧轻量化引擎(车端部署)

  • 推理框架:TensorRT(NVIDIA)、ONNX Runtime、TFLite。
  • 模型压缩:NNCF、PyTorch Pruning,掌握 QAT(量化感知训练)。
  • 端侧 Agent 框架:ROS 2、CyberRT(百度 Apollo)。

② 云端大模型集群(云端大脑)

  • 推理加速:vLLM(PagedAttention)、TensorRT-LLM。
  • Agent 编排:LangChain / LlamaIndex(任务拆解)、DSPy(自动化提示优化)。
  • 异步队列:Celery + Redis(削峰)、Kafka(海量数据回传)。

③ 实时通信“数据管道”

  • 通信协议:MQTT over WebSocket(弱网强项)、gRPC(高实时双向流)。
  • 序列化:Protobuf(比 JSON 小且快);视频流用 H.264/H.265 硬编解码。
  • 策略:智能超时与重传(指数退避)、请求合并(Batching)。

④ 智能路由决策层

  • 置信度打分:端侧模型输出置信度低于阈值(如 0.7)时触发云端请求。
  • 工具:Ray 动态调度,或自建轻量级规则引擎。

校招项目示例

“基于 vLLM 搭建云端服务,车端用 TensorRT 部署 MiniCPM,通过 MQTT 通信。信号弱时本地规则兜底,正常时利用置信度打分动态决定是否上云。”


5. 车领域 Agent 岗位侧重点:搭建 vs 部署 vs 通信 vs 路由

方向 核心关注点 技术重点
Agent 搭建 任务拆解、Prompt 调优、工具调用 LangChain、ReAct、多 Agent 协作
车端部署 模型量化、推理加速、显存优化 TensorRT、ATC、C++/CUDA
实时通信 弱网保活、低延迟、零拷贝 MQTT/gRPC、CyberRT/ROS 2、共享内存
智能路由 置信度判断、端云切换、安全兜底 系统设计、SLA 分级、Fail-safe

结论:对于底层智驾岗位,“车端部署 + 实时通信 + 智能路由”是核心护城河,Agent 搭建是基本功(默认必须会)。


6. AI Agent 岗位 vs AI Infra 岗位的本质区别

维度 AI Agent 工程师(应用层) AI Infra 工程师(系统层)
核心指标 任务成功率、准确率 延迟(Latency)、吞吐(QPS)、显存占用
日常工具 LangChain、Prompt 模板、向量数据库 TensorRT、vLLM、CUDA、ROS 2/CyberRT
优化对象 模型调用的流程和策略 模型推理的速度和资源消耗
典型难题 “Agent 拆解任务错了,怎么改 Prompt?” “Orin 芯片显存爆了,怎么把模型塞进去?”
车端职责 定义“云端规划”和“本地规则”的调用逻辑 保证规划结果在 < 50ms 内到达控制单元

一句话总结AI Agent 是“用模型”,AI Infra 是“供模型”。
底层智驾岗位 = AI Infra 方向,竞争壁垒在于让系统在极限物理条件下稳定运行。


7. 核心工具链详解:TensorRT 与 vLLM

🚀 TensorRT

  • 定位:NVIDIA 专有 GPU 推理优化器,将模型编译为高度优化的“机器码”。
  • 核心技术:算子融合、层剪枝、FP16/INT8 量化。
  • 场景车端/端侧,单次推理必须快(< 50ms)。
  • 校招话术

    “我用 TensorRT 部署 ONNX 模型,通过 INT8 量化和层间融合,将推理从 80ms 优化到 25ms。遇到精度掉点,通过部分层保留 FP32 解决。”

⚡ vLLM

  • 定位:专为 Transformer 大模型设计的高吞吐推理引擎。
  • 核心技术:PagedAttention(将 KV Cache 分页管理,类似 OS 内存管理)。
  • 场景云端部署,支撑海量并发请求。
  • 校招话术

    “vLLM 的 PagedAttention 解决了传统显存利用率低的问题,吞吐量提升数倍,适合云端大模型服务。”


8. 国产化平台:昇腾 NPU / AIC 工具链

层级 工具 对标 NVIDIA
底层架构 CANN(异构计算架构) CUDA
模型优化(大模型) vLLM-Ascend(官方插件) vLLM
模型优化(小模型) MindIE-RT / ATC(转 OM 格式) TensorRT
服务化部署 Triton + torch_npu / MindIE-Service Triton / TensorRT-LLM

校招建议:做一个“在昇腾开发者套件上用 ATC 工具将 ResNet50 转为 OM 模型,并用 Triton 服务化部署”的项目,直接命中国产化替代痛点。


9. 核心概念:端侧模型 vs 多模态模型

维度 端侧模型 多模态模型
分类标准 部署位置(本地 vs 云端) 输入数据类型(单模态 vs 多模态)
关注点 体积小、功耗低、速度快 能看懂图片、听懂声音
代表模型 MobileNet、TinyBERT、Phi-3 CLIP、Flamingo、GPT-4V、BEVFormer
在车里 部署在 Orin/地平线芯片上的模型 融合摄像头和雷达数据的模型

面试必考题:“怎么把多模态模型部署到端侧?”

  • 答:蒸馏到 3B 以下 → INT8 量化 → 异构计算(NPU + CPU 异步流水线)。

10. 底层智驾 Infra 技术栈蓝图(总览)

🚗 车端:多模态与实时控制

⚙️ 硬件与芯片生态

NVIDIA Orin
(TensorRT/CUDA)

昇腾NPU
(CANN/vLLM-Ascend)

地平线征程
(HBDNN/Toolchain)

☁️ 云端:大模型与复杂Agent

推理引擎
vLLM / TensorRT-LLM

模型库
DeepSeek / Qwen / LLaMA

部署套件
MindIE / Triton

应用层 & Agent编排
(座舱/智驾应用)

端云智能路由层
(决策调度)

推理加速
TensorRT / ATC

轻量模型
MobileNet / TinyBERT

智驾通信
CyberRT / ROS 2

功能安全 & 基础库
ISO 26262 / C++17 / 内存池 / 无锁队列

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐