[论文阅读] 人工智能 | 内容审核员减负神器!多模态大模型方法让“隐喻识别”“图文关联审核”不再难
内容审核员减负神器!多模态大模型方法让“隐喻识别”“图文关联审核”不再难
论文信息
| 信息类别 | 具体内容 |
|---|---|
| 论文原标题 | 基于多模态大模型的内容审核方法 |
| 主要作者 | 赵磊、李志学、樊翠芳、李芳雅(通信作者)、喻渡渡、费有文 |
| 研究机构 | 央视国际网络有限公司(北京 100038) |
| 发表期刊 | 《计算机工程与应用》(ISSN 1002-8331,CN 11-2127/TP),网络首发 |
| 网络首发日期 | 2025-08-27 |
| 网络首发地址 | https://link.cnki.net/urlid/11.2127.tp.20250827.1405.010 |
| APA 引文格式 | 赵磊, 李志学, 樊翠芳, 李芳雅, 喻渡渡, 费有文. (2025). 基于多模态大模型的内容审核方法. 计算机工程与应用. https://doi.org/10.3778/j.issn.1002-8331.2501-0283 |
一段话总结
赵磊团队针对“人工内容审核效率低、易漏检”和“传统智能审核看不懂隐喻/讽刺、不会融合多模态信息”的痛点,提出了基于多模态大模型的内容审核方案:用ChatGLM-6b处理“负面文章”“负面文评”2类文本场景,用CogVLM-17b处理“丑化人物形象”“图文不良隐射”2类图像场景;同时构建了覆盖4大场景的新闻图文数据集(含9057条文本、8817张图像),通过Lora微调与实验验证,该方案在所有场景中准确率均超90%(最高97.9%),比传统AI方法(如Bert、Yolov8)准确率提升14.6%-26.0%,既能精准识别深层语义风险,又能大幅减轻审核人员负担。
思维导图

研究背景
咱们先想个场景:你是某新闻平台的审核员,每天要盯成千上万条新闻——有文字、有图片,还有带评论的图文。如果全靠你人工看,一天下来眼睛都花了,还可能漏了“反话”(比如灾难新闻下有人说“真开心”);如果用以前的AI审核,它可能只会认“骂人的词”,却看不懂“中国父母总让孩子吃苦,不如外国快乐”这种藏着价值导向问题的话,更别说“一张正能量图片+一句讽刺评论”的组合套路了。
这就是现在内容审核的两大“老大难”:
- 人工审核像“蚂蚁搬砖”:效率低、易出错,人还累。比如某平台一天有10万条内容,10个审核员拼尽全力也可能漏检1%,而这1%就可能引发问题;
- 传统智能审核像“小学生读课文”:只会“字面理解”,不会“深层思考”。它基于固定场景的深度学习,比如只学过“骂人的话是负面”,没学过“讽刺话是负面”,更不会把“图片+文字”放一起看——就像你只给它看“苹果”图、只教它“苹果”词,它永远不知道“苹果图+‘这水果酸’评论”是在说苹果不好。
而内容审核又不能马虎:一旦漏了违法、恶意的内容,不仅会误导公众,还会让平台失去公信力,甚至影响社会稳定。所以,急需一种能“看懂深层含义、会结合多模态”的智能审核方法——这就是赵磊团队做这个研究的原因。
创新点
这篇论文的“新”不是瞎创新,而是精准戳中行业痛点,主要有4个亮点:
-
场景覆盖“全而准”:别人的方法可能只盯“文本”或“单张图片”,这篇直接覆盖4个最常见的审核场景——不仅有“单条新闻是不是负面”(场景一),还有“新闻+评论一起看是不是负面”(场景二);不仅看“图片是不是丑化人”(场景三),还看“图片+评论是不是藏猫腻”(场景四),几乎把新闻平台的核心审核需求都包了。
-
模型选择“专而配”:没有用“一个模型包打天下”,而是让ChatGLM-6b管文本(它擅长理解文字语义)、CogVLM-17b管图像(它能把图文捏合到一起),就像让语文老师改作文、美术老师评画作,专业的人干专业的事,效果自然更好。
-
数据集“贴实际”:以前的数据集可能只标“正面/负面”,这篇的数据集还标“负面原因”(比如“传播谣言”“讽刺社会”)——就像老师改作业不仅打“×”,还告诉你错在哪,模型学起来更明白,用的时候也能给审核员说清“为啥这条是负面”,更贴实际工作流。
-
训练方法“省又稳”:用了“Lora微调”(只改模型小部分参数),不用从头训大模型,省了很多计算资源;还混了“通用语料”(比如CogVLM-SFT-311K双语数据),防止模型只学了审核知识、忘了通用语义(比如不会认“腹黑”这种日常词),避免“学了新的忘旧的”。
研究方法和思路
这部分咱们拆成“文本处理”“图像处理”“数据集构建”“实验设计”4步,一步步说清楚:
1. 文本场景处理(用ChatGLM-6b,管场景一、二)
步骤1:理解模型原理——“填空白”学语义
ChatGLM的核心 trick 是“自回归空白填充”:比如给它一句“中国是世界上最大的[M]排放国”([M]是空白),它会根据知识填“温室气体”;如果原文是“中国是世界上最大的温室气体排放国,会放弃碳中和”(假新闻),它填完后会结合“放弃碳中和是谣言”的判断,标为负面。简单说,就是通过“补全句子”理解文字深层含义。
步骤2:微调模型——让它更懂“审核”
- 数据:用场景一(负面文章)、场景二(负面文评)的文本数据,每条标“正面/负面+原因”;
- 方法:用Lora微调(只改模型1%左右的参数,省资源),用“交叉熵损失”(让模型预测的结果和人工标注的越像越好);
- 细节:输入文本最长128个词(够装一条新闻或评论),学习率先低后稳(避免学偏)。
2. 图像场景处理(用CogVLM-17b,管场景三、四)
步骤1:模型组件——4个部分缺一不可
- ViT encoder:把图片拆成“小块”,转成机器能懂的数字(图像特征);
- MLP适配器:把图像特征“翻译”成文本特征的格式(比如和ChatGLM认的词向量一样长);
- LLM(大语言模型):负责理解语义(和ChatGLM的核心部分类似);
- 视觉专家模块:关键!让图像特征和文本特征“对齐”(比如知道“图里的人”对应“评论里的‘腹黑角色’”)。
步骤2:图文融合——让模型“看图说话+看评论懂套路”
比如场景四(图文隐射):输入“老奶奶感谢明星”的图片+“她总这表情,是腹黑”的评论。模型先把图片转成特征,再和评论文本特征拼一起,通过视觉专家模块关联“图片里的微笑”和“评论里的腹黑”,最后判断“这是讽刺正面人物,算负面”。
3. 数据集构建(从0到1造“训练材料”)
步骤1:采集数据——找对来源,补全缺口
- 文本:爬国内外权威新闻网站(比如央视新闻、路透社),用THULAC工具(清华大学的中文分词工具)筛出正负面内容,负面内容多采点(因为审核更关注负面);
- 图像:国内渠道找正面图,Youtube补负面图(解决“正面图太多”的问题),比如场景三(丑化人物)找了9243张图。
步骤2:标注数据——6人分组,层层把关
- 分组:6个专业审核员分3组,每组审1/3数据;
- 标注:标“1(正面)”或“2(负面+原因)”,比如“图片丑化人物”标2,原因写“恶意丑化形象”;
- 纠错:组内两人标得不一样的,让另一组重审;还不一样的,直接丢了(避免模糊数据误导模型)。
步骤3:拆分数据——分训练/验证/测试集
- 文本场景(一、二):按8:1:1拆(比如场景一4476条,训练3626条、验证450条、测试400条);
- 图像场景(三、四):微调比例(比如场景三6243张,训练4518条),保证正负数据差不多(避免模型只学正面)。
4. 实验设计(验证效果的“考试”)
- 硬件:8张NVIDIA H800 GPU(够跑大模型),系统Ubuntu 22.04;
- 参数:每次喂4条数据(batch=4),训20轮(epoch=20),学率按场景调(文本用“热身涨”,图像用“余弦降”);
- 评价标准:看“准确率”(判对的比例)、“精确率”(判负面里真负面的比例)、“召回率”(真负面里判对的比例)——三个指标都高才叫真好用。
主要成果和贡献
1. 核心成果
| 核心问题(RQ) | 解决方法 | 实验结果(验证集) | 比传统AI提升幅度 |
|---|---|---|---|
| 文本负面(含评论)怎么判? | ChatGLM-6b+场景化微调 | 准确率93.8%(场景一)、94.2%(二) | 超Bert 16.7%-24.7% |
| 图像负面(含隐射)怎么判? | CogVLM-17b+视觉专家模块 | 准确率97.9%(场景三)、96.8%(四) | 超Yolov8 17.4%-33.1% |
| 模型能不能实际部署? | 量化+Lora微调 | 文本~15词/秒,图像<2秒/张 | 与传统审核平台速度接近 |
| 数据集够不够用? | 6人标注+场景化拆分 | 覆盖4场景,共17874条数据 | 含负面原因标注,更贴实际 |
2. 实实在在的贡献
- 对审核员:以前你要盯“文本+评论+图片”,现在模型先帮你筛一遍,只把“拿不准的”给你看——比如模型能自动标出“‘中国放弃碳中和’是谣言”“老奶奶图+腹黑评论是讽刺”,你工作量至少减一半,还少漏检。
- 对行业:解决了“AI看不懂深层语义”“不会多模态融合”的老问题——比如以前AI判不了“讽刺话”,现在能了;以前AI看不了“图文组合”,现在能了,相当于给智能审核升了个级。
- 对研究:给后来人留了“素材”——公开了数据集构建方法(怎么采、怎么标),还验证了ChatGLM+CogVLM的组合好用,别人可以照着这个思路做更复杂的审核(比如加视频)。
3. 开源信息
论文中未提及代码或数据集开源地址,暂无法提供(后续可关注《计算机工程与应用》期刊或作者单位官网,可能会更新)。
关键问题
Q1:这方法怎么解决“传统AI看不懂隐喻/讽刺”的问题?
A:靠两个关键点:① 文本用ChatGLM的“自回归空白填充”——比如“中国父母让孩子吃苦,不如外国快乐”,模型会填“这种说法忽略吃苦的意义,价值导向错”,从而理解深层问题;② 图像用CogVLM的“视觉专家模块”——比如“老奶奶感谢明星图+腹黑评论”,模块会关联“图的正面”和“评论的负面”,识破隐射。简单说,就是让模型“像人一样读上下文、联图文”。
Q2:为什么要分4个场景,不能用一个模型管所有?
A:因为4个场景的“审核重点”不一样:场景一只要看文本,场景二要文本+评论,场景三只要看图像,场景四要图像+评论——就像你不会用一把尺子量“长度”和“重量”。分场景后,模型可以“专注学一类任务”,比如ChatGLM不用学看图,CogVLM不用学纯文本,效果反而更好;而且分场景也更贴实际(审核员就是按“文本/图像/带评论”分任务的)。
Q3:实验里准确率超90%,实际用的时候能稳定吗?
A:从两个点看是稳定的:① 数据够多样——文本来自国内外网站,图像补了Youtube的,覆盖不同场景;② 训练够严谨——用了“混合通用语料”防模型“偏科”,还做了“消融实验”(验证视觉专家模块必须有),不是“碰运气”好;③ 速度够快——能跟上平台内容更新节奏,不会“审得慢导致内容积压”。所以实际部署时,只要数据和实验时差不多,准确率不会掉太多。
Q4:未来还能怎么优化?
A:论文里提了3个方向,都很实用:① 加模态——现在只做文本和图像,以后加音频(比如恶意言论录音)、视频(比如暴力片段);② 扩数据——现在数据量不算特别大,以后多采点,尤其是“少见的负面场景”(比如新型隐射套路);③ 提速度——现在图像要2秒/张,以后做“轻量化模型”,让手机都能跑(比如小平台用)。
十、总结
赵磊团队的《基于多模态大模型的内容审核方法》,精准解决了当前内容审核“人工效率低、传统AI理解浅”的痛点。研究通过“分场景选模型”(ChatGLM管文本、CogVLM管图像)、“建场景化数据集”(带负面原因标注)、“巧做训练”(Lora+通用语料),实现了4大审核场景的高准确率(93.8%-97.9%),且性能显著优于传统AI方法。
这项研究的核心价值在于:既提升了智能审核的“深度”(能识别隐喻、图文隐射),又保证了“实用性”(速度接近传统平台,可部署),不仅能减轻审核人员负担,还能帮助媒体平台更好地过滤不良信息,维护公信力。
当然,研究也有可改进的地方——比如数据量还能扩、没覆盖音视频模态,但整体来看,它为多模态内容审核提供了“可落地、可参考”的新方案,是一次很有价值的探索。
更多推荐



所有评论(0)