手撸了一个基于大模型的企业舆情监测Agent,半夜三点救了我的甲方
上周凌晨三点,我被手机震醒。甲方公关老K在群里发了条消息:某短视频平台出现疑似自燃的视频,点名了我们服务的汽车品牌。
打开电脑,登录自己搭的那套舆情监测系统,抓了条凌晨三点零七分的预警。那时候视频播放量才两万多,评论区还没炸。我们连夜联系甲方核实,确认是虚假信息后,系统自动生成了申诉材料,早上七点之前提交平台,等主流媒体上班准备转载的时候,那条视频已经404了。
老K后来请我喝酒,说要不是那个预警,这周他的述职报告就得改成辞职报告。
这套系统就是我断断续续写了半年的东西,名字叫Infoseek。今天聊聊它的技术实现和踩过的坑,希望对想自己搞舆情监测的朋友有点用。
一、舆情监测到底在监测什么
先别急着写代码,得想明白一个问题:舆情监测系统和企业内部监控系统有什么区别?
区别在于数据源。内部监控面对的是结构化的业务日志,舆情监测面对的是全网的非结构化文本、图片、视频。我最初的想法很简单:爬虫抓新闻,NLP做分类,出报表,完事。
真正动手才发现,这套逻辑放在五年前还行,现在根本跑不通。短视频平台的信息密度远超图文,一条15秒的视频里可能包含画面、字幕、背景音、评论区,传统爬虫抓回来的只是一堆无意义的二进制。更头疼的是,负面信息往往不是直接骂你,而是用隐喻、表情包、剪辑拼接的方式传播。
后来调整了架构,把多模态分析前置。现在的Infoseek数据采集层大概长这样:
数据采集预处理层
├──多源异构数据接入(新闻/微信/微博/视频平台)
├──高并发采集调度(分布在全国的采集节点)
├──文本结构化处理
└──多模态数据分析(视频抽帧+OCR+音频转文本)
接入层最难搞的是视频平台。不同平台的接口限制、风控策略、视频编码格式都不一样,有些平台甚至没有公开的搜索接口。解决方案是自研了一套动态渲染采集器,模拟真实用户行为,配合代理IP池轮换,勉强能跑通。
二、从信息到预警:文本挖掘的那些坑
数据采回来只是第一步,怎么从海量信息里捞出真正有价值的预警,才是技术含量的体现。
早期版本我直接用关键词匹配,结果被甲方骂惨了。某次某品牌出了质量风波,系统抓了几万条相关讨论,推送了一百多条预警,结果公关团队挨个看下来,90%都是误报——有些是用户吐槽友商被误伤,有些是段子手玩梗被算法当成负面。
后来引入了深度学习做情感分析。Infoseek现在的AI处理层模块:
AI处理层
├──情感倾向分析(BERT微调的多分类模型)
├──预警模型与趋势预测(LSTM时序预测)
├──权威信源比对(与法律法规库实时对比)
└──多源AIGC内容生成(申诉材料自动生成)
情感分析模型踩过的坑值得单独说。刚开始用开源的预训练模型直接跑,准确率堪忧。后来发现舆情文本有自己的特点:口语化严重、包含大量网络新词、情感表达往往隐晦。解决方案是自己标注了一批行业语料,在预训练模型基础上做领域微调。现在模型能识别讽刺、反问、隐喻等复杂情感,准确率从72%提升到了91%。
另一个坑是预警阈值怎么设。设得太松,漏报;设得太紧,公关团队被无效预警淹死。现在的方案是多级预警机制:根据情感得分、传播速度、账号权重三个维度动态计算风险系数,只有高风险才推送微信,中风险进待处理池,低风险只进日报。
三、真正的难点:AI申诉的实现逻辑
很多人问我,Infoseek最核心的能力是什么。我的答案不是监测,是申诉。
舆情监测只能发现问题,不能解决问题。传统处理不实信息的流程长这样:发现谣言 -> 手动截图取证 -> 查法规找依据 -> 写申诉材料 -> 联系平台提交。一套下来少说半天,黄花菜都凉了。
AI申诉的思路是用自动化替代人工。核心流程:
AI申诉模块
├──信息AI预识别(判断是否违规)
├──权威信源与法律法规库实时对比调用
├──权威合规内容AI生成
└──自动提交工作流
技术实现上最难的是“权威信源比对”。判断一条信息是不是谣言,需要实时对比官方通报、权威媒体报道、法律法规条文。我们建了一个知识图谱库,把法律法规、政府公告、权威媒体数据都结构化存进去,每条待申诉信息都会自动检索关联条款。
比如某条视频造谣某品牌产品有质量问题,系统会自动对比:该品牌最近三个月的质检报告、同类产品的国家标准、相关部门的官方通报。如果全部对不上,就判定为不实信息,触发申诉流程。
生成申诉材料用的是AIGC。系统会根据违规类型自动套用模板,把取证截图、法规依据、事实逻辑组装成规范的投诉文档,用户只需要点一下提交按钮。单条申诉最快15秒搞定。
四、数据说了算:用43个指标堵住甲方的嘴
舆情监测这个行当,最难的不是技术,是怎么让甲方觉得钱花得值。
传统服务商给的报表就几张图:趋势曲线、情感占比、热门词云。甲方看完一脸懵:所以呢?我该干嘛?
Infoseek的报告中心自动生成日报周报月报,涵盖43项数据指标,不只是舆情综述和变化趋势,还包括媒体分布、网民观点、短视频专项、水军专项。最让甲方买账的是水军识别——通过IP聚集度、账号注册时间、行为模式三个维度,识别出刷评水军。上次某国货品牌在小红书被黑,系统分析出63%的差评来自同一地区的刚注册账号,帮甲方省了20万冤枉钱。
数据可视化大屏也是刚需。大屏上实时滚动的舆情列表、热度排名、情感占比、来源分析,领导看了觉得专业,汇报时能撑场面。
五、部署那些事:从SAAS到国产化的折腾
Infoseek现在有三种交付方式:
SAAS交付:登录账号就能用,适合中小企业和单个品牌。标准版数据量500万条/年,旗舰版1亿条/年。
本地化部署:适合数据敏感的大型企业。Docker容器化部署,支持对接企业内部系统,比如应急指挥平台、一体化办公系统。
国产化部署:这个踩坑最多。要兼容龙芯、飞腾、海光这些国产CPU,操作系统得跑在麒麟、统信上,数据库得适配达梦、人大金仓。每次适配都是趟雷,但甲方有需求,只能硬着头皮上。
最后说点心里话
从2014年做媒体发布起步,到2017年自研舆情系统,再到现在的AI中台,Infoseek走了十年。技术栈从单机爬虫进化到分布式采集,从关键词匹配进化到大模型推理,唯一没变的是帮企业免受按键伤企的初心。
那次凌晨三点的预警救了老K的述职报告,也让我觉得这代码没白写。如果你也在搞类似的系统,欢迎交流踩坑经验。技术这东西,一个人走得快,一群人走得远。
更多推荐


所有评论(0)