内容审核员减负神器!多模态大模型方法让“隐喻识别”“图文关联审核”不再难

论文信息

信息类别具体内容
论文原标题基于多模态大模型的内容审核方法
主要作者赵磊、李志学、樊翠芳、李芳雅(通信作者)、喻渡渡、费有文
研究机构央视国际网络有限公司(北京 100038)
发表期刊《计算机工程与应用》(ISSN 1002-8331,CN 11-2127/TP),网络首发
网络首发日期2025-08-27
网络首发地址https://link.cnki.net/urlid/11.2127.tp.20250827.1405.010
APA 引文格式赵磊, 李志学, 樊翠芳, 李芳雅, 喻渡渡, 费有文. (2025). 基于多模态大模型的内容审核方法. 计算机工程与应用. https://doi.org/10.3778/j.issn.1002-8331.2501-0283

一段话总结

赵磊团队针对“人工内容审核效率低、易漏检”和“传统智能审核看不懂隐喻/讽刺、不会融合多模态信息”的痛点,提出了基于多模态大模型的内容审核方案:用ChatGLM-6b处理“负面文章”“负面文评”2类文本场景,用CogVLM-17b处理“丑化人物形象”“图文不良隐射”2类图像场景;同时构建了覆盖4大场景的新闻图文数据集(含9057条文本、8817张图像),通过Lora微调与实验验证,该方案在所有场景中准确率均超90%(最高97.9%),比传统AI方法(如Bert、Yolov8)准确率提升14.6%-26.0%,既能精准识别深层语义风险,又能大幅减轻审核人员负担。

思维导图

在这里插入图片描述

研究背景

咱们先想个场景:你是某新闻平台的审核员,每天要盯成千上万条新闻——有文字、有图片,还有带评论的图文。如果全靠你人工看,一天下来眼睛都花了,还可能漏了“反话”(比如灾难新闻下有人说“真开心”);如果用以前的AI审核,它可能只会认“骂人的词”,却看不懂“中国父母总让孩子吃苦,不如外国快乐”这种藏着价值导向问题的话,更别说“一张正能量图片+一句讽刺评论”的组合套路了。

这就是现在内容审核的两大“老大难”:

  1. 人工审核像“蚂蚁搬砖”:效率低、易出错,人还累。比如某平台一天有10万条内容,10个审核员拼尽全力也可能漏检1%,而这1%就可能引发问题;
  2. 传统智能审核像“小学生读课文”:只会“字面理解”,不会“深层思考”。它基于固定场景的深度学习,比如只学过“骂人的话是负面”,没学过“讽刺话是负面”,更不会把“图片+文字”放一起看——就像你只给它看“苹果”图、只教它“苹果”词,它永远不知道“苹果图+‘这水果酸’评论”是在说苹果不好。

而内容审核又不能马虎:一旦漏了违法、恶意的内容,不仅会误导公众,还会让平台失去公信力,甚至影响社会稳定。所以,急需一种能“看懂深层含义、会结合多模态”的智能审核方法——这就是赵磊团队做这个研究的原因。

创新点

这篇论文的“新”不是瞎创新,而是精准戳中行业痛点,主要有4个亮点:

  1. 场景覆盖“全而准”:别人的方法可能只盯“文本”或“单张图片”,这篇直接覆盖4个最常见的审核场景——不仅有“单条新闻是不是负面”(场景一),还有“新闻+评论一起看是不是负面”(场景二);不仅看“图片是不是丑化人”(场景三),还看“图片+评论是不是藏猫腻”(场景四),几乎把新闻平台的核心审核需求都包了。

  2. 模型选择“专而配”:没有用“一个模型包打天下”,而是让ChatGLM-6b管文本(它擅长理解文字语义)、CogVLM-17b管图像(它能把图文捏合到一起),就像让语文老师改作文、美术老师评画作,专业的人干专业的事,效果自然更好。

  3. 数据集“贴实际”:以前的数据集可能只标“正面/负面”,这篇的数据集还标“负面原因”(比如“传播谣言”“讽刺社会”)——就像老师改作业不仅打“×”,还告诉你错在哪,模型学起来更明白,用的时候也能给审核员说清“为啥这条是负面”,更贴实际工作流。

  4. 训练方法“省又稳”:用了“Lora微调”(只改模型小部分参数),不用从头训大模型,省了很多计算资源;还混了“通用语料”(比如CogVLM-SFT-311K双语数据),防止模型只学了审核知识、忘了通用语义(比如不会认“腹黑”这种日常词),避免“学了新的忘旧的”。

研究方法和思路

这部分咱们拆成“文本处理”“图像处理”“数据集构建”“实验设计”4步,一步步说清楚:

1. 文本场景处理(用ChatGLM-6b,管场景一、二)

步骤1:理解模型原理——“填空白”学语义

ChatGLM的核心 trick 是“自回归空白填充”:比如给它一句“中国是世界上最大的[M]排放国”([M]是空白),它会根据知识填“温室气体”;如果原文是“中国是世界上最大的温室气体排放国,会放弃碳中和”(假新闻),它填完后会结合“放弃碳中和是谣言”的判断,标为负面。简单说,就是通过“补全句子”理解文字深层含义。

步骤2:微调模型——让它更懂“审核”
  • 数据:用场景一(负面文章)、场景二(负面文评)的文本数据,每条标“正面/负面+原因”;
  • 方法:用Lora微调(只改模型1%左右的参数,省资源),用“交叉熵损失”(让模型预测的结果和人工标注的越像越好);
  • 细节:输入文本最长128个词(够装一条新闻或评论),学习率先低后稳(避免学偏)。

2. 图像场景处理(用CogVLM-17b,管场景三、四)

步骤1:模型组件——4个部分缺一不可
  • ViT encoder:把图片拆成“小块”,转成机器能懂的数字(图像特征);
  • MLP适配器:把图像特征“翻译”成文本特征的格式(比如和ChatGLM认的词向量一样长);
  • LLM(大语言模型):负责理解语义(和ChatGLM的核心部分类似);
  • 视觉专家模块:关键!让图像特征和文本特征“对齐”(比如知道“图里的人”对应“评论里的‘腹黑角色’”)。
步骤2:图文融合——让模型“看图说话+看评论懂套路”

比如场景四(图文隐射):输入“老奶奶感谢明星”的图片+“她总这表情,是腹黑”的评论。模型先把图片转成特征,再和评论文本特征拼一起,通过视觉专家模块关联“图片里的微笑”和“评论里的腹黑”,最后判断“这是讽刺正面人物,算负面”。

3. 数据集构建(从0到1造“训练材料”)

步骤1:采集数据——找对来源,补全缺口
  • 文本:爬国内外权威新闻网站(比如央视新闻、路透社),用THULAC工具(清华大学的中文分词工具)筛出正负面内容,负面内容多采点(因为审核更关注负面);
  • 图像:国内渠道找正面图,Youtube补负面图(解决“正面图太多”的问题),比如场景三(丑化人物)找了9243张图。
步骤2:标注数据——6人分组,层层把关
  • 分组:6个专业审核员分3组,每组审1/3数据;
  • 标注:标“1(正面)”或“2(负面+原因)”,比如“图片丑化人物”标2,原因写“恶意丑化形象”;
  • 纠错:组内两人标得不一样的,让另一组重审;还不一样的,直接丢了(避免模糊数据误导模型)。
步骤3:拆分数据——分训练/验证/测试集
  • 文本场景(一、二):按8:1:1拆(比如场景一4476条,训练3626条、验证450条、测试400条);
  • 图像场景(三、四):微调比例(比如场景三6243张,训练4518条),保证正负数据差不多(避免模型只学正面)。

4. 实验设计(验证效果的“考试”)

  • 硬件:8张NVIDIA H800 GPU(够跑大模型),系统Ubuntu 22.04;
  • 参数:每次喂4条数据(batch=4),训20轮(epoch=20),学率按场景调(文本用“热身涨”,图像用“余弦降”);
  • 评价标准:看“准确率”(判对的比例)、“精确率”(判负面里真负面的比例)、“召回率”(真负面里判对的比例)——三个指标都高才叫真好用。

主要成果和贡献

1. 核心成果

核心问题(RQ)解决方法实验结果(验证集)比传统AI提升幅度
文本负面(含评论)怎么判?ChatGLM-6b+场景化微调准确率93.8%(场景一)、94.2%(二)超Bert 16.7%-24.7%
图像负面(含隐射)怎么判?CogVLM-17b+视觉专家模块准确率97.9%(场景三)、96.8%(四)超Yolov8 17.4%-33.1%
模型能不能实际部署?量化+Lora微调文本~15词/秒,图像<2秒/张与传统审核平台速度接近
数据集够不够用?6人标注+场景化拆分覆盖4场景,共17874条数据含负面原因标注,更贴实际

2. 实实在在的贡献

  • 对审核员:以前你要盯“文本+评论+图片”,现在模型先帮你筛一遍,只把“拿不准的”给你看——比如模型能自动标出“‘中国放弃碳中和’是谣言”“老奶奶图+腹黑评论是讽刺”,你工作量至少减一半,还少漏检。
  • 对行业:解决了“AI看不懂深层语义”“不会多模态融合”的老问题——比如以前AI判不了“讽刺话”,现在能了;以前AI看不了“图文组合”,现在能了,相当于给智能审核升了个级。
  • 对研究:给后来人留了“素材”——公开了数据集构建方法(怎么采、怎么标),还验证了ChatGLM+CogVLM的组合好用,别人可以照着这个思路做更复杂的审核(比如加视频)。

3. 开源信息

论文中未提及代码或数据集开源地址,暂无法提供(后续可关注《计算机工程与应用》期刊或作者单位官网,可能会更新)。

关键问题

Q1:这方法怎么解决“传统AI看不懂隐喻/讽刺”的问题?

A:靠两个关键点:① 文本用ChatGLM的“自回归空白填充”——比如“中国父母让孩子吃苦,不如外国快乐”,模型会填“这种说法忽略吃苦的意义,价值导向错”,从而理解深层问题;② 图像用CogVLM的“视觉专家模块”——比如“老奶奶感谢明星图+腹黑评论”,模块会关联“图的正面”和“评论的负面”,识破隐射。简单说,就是让模型“像人一样读上下文、联图文”。

Q2:为什么要分4个场景,不能用一个模型管所有?

A:因为4个场景的“审核重点”不一样:场景一只要看文本,场景二要文本+评论,场景三只要看图像,场景四要图像+评论——就像你不会用一把尺子量“长度”和“重量”。分场景后,模型可以“专注学一类任务”,比如ChatGLM不用学看图,CogVLM不用学纯文本,效果反而更好;而且分场景也更贴实际(审核员就是按“文本/图像/带评论”分任务的)。

Q3:实验里准确率超90%,实际用的时候能稳定吗?

A:从两个点看是稳定的:① 数据够多样——文本来自国内外网站,图像补了Youtube的,覆盖不同场景;② 训练够严谨——用了“混合通用语料”防模型“偏科”,还做了“消融实验”(验证视觉专家模块必须有),不是“碰运气”好;③ 速度够快——能跟上平台内容更新节奏,不会“审得慢导致内容积压”。所以实际部署时,只要数据和实验时差不多,准确率不会掉太多。

Q4:未来还能怎么优化?

A:论文里提了3个方向,都很实用:① 加模态——现在只做文本和图像,以后加音频(比如恶意言论录音)、视频(比如暴力片段);② 扩数据——现在数据量不算特别大,以后多采点,尤其是“少见的负面场景”(比如新型隐射套路);③ 提速度——现在图像要2秒/张,以后做“轻量化模型”,让手机都能跑(比如小平台用)。

十、总结

赵磊团队的《基于多模态大模型的内容审核方法》,精准解决了当前内容审核“人工效率低、传统AI理解浅”的痛点。研究通过“分场景选模型”(ChatGLM管文本、CogVLM管图像)、“建场景化数据集”(带负面原因标注)、“巧做训练”(Lora+通用语料),实现了4大审核场景的高准确率(93.8%-97.9%),且性能显著优于传统AI方法。

这项研究的核心价值在于:既提升了智能审核的“深度”(能识别隐喻、图文隐射),又保证了“实用性”(速度接近传统平台,可部署),不仅能减轻审核人员负担,还能帮助媒体平台更好地过滤不良信息,维护公信力。

当然,研究也有可改进的地方——比如数据量还能扩、没覆盖音视频模态,但整体来看,它为多模态内容审核提供了“可落地、可参考”的新方案,是一次很有价值的探索。

Logo

码道开发者社区,聚焦华为云码道 CodeArts 代码智能体,沉淀 Agent、Skill、鸿蒙开发实战内容,供开发者查阅资料、交流技术、分享工程实践

更多推荐