一条视频下面有两千条评论,“求教程”“这个怎么收费”“和 XX 有什么区别”都被顶得很高。很多运营动作到这里就结束了:把高赞评论丢给 AI,让它总结“用户关心什么”,再按总结写下一篇。结果通常是内容更泛、更像 FAQ,也没有解决真正的购买阻力。
评论区不是投票器。高赞可能来自段子、立场认同或抢沙发;没有被顶起来的重复提问,反而可能说明新用户一直卡在同一个步骤。AI 的价值不在于替你决定选题,而是把杂乱对话转成可核对的信号:谁在问、他要完成什么、缺什么信息、这件事能否由现有产品或内容回答。
先别导入全部评论,先定义你要找什么
一次复盘最好只围绕一个目标。常见目标包括:找下周教程选题、发现购买前的疑虑、确认某个功能是否难理解、收集用户原话做落地页,或者判断一次活动为什么没人参与。不同目标需要的筛选规则不同,混在一起让 AI “总结情绪”,结论一定会变得模糊。
以“找教程选题”为例,优先保留四类评论:提出明确任务的提问;描述失败或卡点的反馈;要求对比、价格或适用边界的提问;同一问题被不同用户反复问到。纯表情、抽奖、无上下文的“求同款”,以及和主题无关的争论可以留在原始表里,但不要让它们占据分析上下文。
导出时保留证据,而不是只留一句评论
把评论导进表格时,至少保留:评论文本、发布时间、点赞数、回复数、视频/帖子的主题、是否为作者回复、父评论、账号可见的语言或地区、链接和人工初判。不要只把“评论文本”一列喂给模型。没有原帖主题,AI 很容易误解“这个不行”究竟是在说价格、效果还是剪辑风格;没有父评论,它也看不懂回复中的“第二种方法”。
再增加两列:原始问题和可验证事实。前者用最少的话复述用户要完成的事情,例如“想知道免费版能否导出无水印”;后者写清楚需要查什么,例如套餐页、帮助中心、产品实测或客服政策。这样能防止团队把猜测直接写成内容答案。
让 AI 做标注员,而不是内容总监
把每批控制在 100 到 200 条,并要求输出结构化结果。下面的提示词可以直接使用:
你是用户研究助理。根据评论和上下文,对每条记录标注一个主要意图:操作求助、功能理解、价格/购买疑虑、对比选择、使用障碍、正向反馈、跑题或无法判断。提取用户想完成的任务,保留原话中的关键限定条件。不要推测用户身份、需求规模或购买意愿。对可以由公开资料核验的问题,写出需要核验的事实;上下文不足时标记“无法判断”。输出:评论 ID、意图、任务、关键原话、需核验事实、置信度。
这里最重要的约束是“不要推测”。例如“有没有便宜一点的”不等于用户一定会购买;“为什么我这里没有这个按钮”也不必然说明产品有 bug。模型可以归类,但不能把一条留言升级成商业结论。
从评论簇里挑选题,而不是挑一句金句
完成标注后,用透视表或筛选器看重复的“任务 + 限定条件”。一个值得写的选题通常同时满足三件事:至少有多个独立用户在问;问题能给出具体可执行的答案;答案和你的产品、服务或已有资料有真实关联。
例如,十几个人分别问“模板在哪里”“手机能不能编辑”“导出后字体变了”,表面上是三个问题,背后可能是“从下载到交付的完整流程不透明”。这时下一篇不该只写“模板下载地址”,而应该做一篇含设备差异、导入方式、字体替换和交付检查的教程。反过来,单条高赞的“能不能免费送我一个”,不值得被包装成选题。
加一个简单的选题评分,防止谁声音大就写谁
推荐给每个评论簇打四个 0—3 分:
- 重复度:是否来自多个独立账号,而非同一串回复。
- 具体度:是否能明确描述任务、条件和预期结果。
- 可回答度:团队是否能用事实、演示或明确政策回答。
- 业务关联:内容是否和目标受众、产品能力或转化路径相关。
总分高的优先写;“重复度高但可回答度低”的问题应先交给产品或客服,不要用一篇文案来掩盖问题。这样做的好处是,当有人问“为什么不写那条高赞评论”时,你能解释选择依据,而不是凭感觉争论。
写作前先核验,再让 AI 搭结构
AI 可以把一组已经核验的事实变成大纲,但别让它从评论里编答案。先由负责人补齐事实来源,再使用这样的提示:
基于以下已核验事实和用户问题,设计一篇教程大纲。开头从用户实际卡住的任务切入,不要写泛泛的趋势判断。每个小节只解决一个步骤或选择;清楚区分适用条件、限制和替代方案。不得加入未提供的价格、功能、效果或承诺。最后给出一个可执行检查清单,并列出还不能确认的问题。
需要核对外部工具、价格或产品规则时,可以先用 Perplexity 找到候选来源,再回到官方页面确认。用 ChatGPT 处理分类和大纲时,则应只输入已脱敏的评论;订单号、电话号码、邮箱、私信截图和未公开客户资料都不该进入提示词。
每周只需 40 分钟的复盘节奏
- 周一导出上周表现较好的 3—5 条内容的评论,先去掉明显垃圾信息。
- 人工快速抽样 20 条,确认本周的分析目标和意图标签没有跑偏。
- 用 AI 分批标注,随机复核每类 5—10 条,修正错误分类。
- 合并成评论簇,完成评分;优先选 1—2 个“可验证且可回答”的问题。
- 发布后追踪新评论是否减少了原问题,或出现了更靠后的问题。这才是内容是否真正有用的信号。
持续做几周后,你会得到一份比“爆款模板”更可靠的选题库:它记录的是用户正在努力完成的工作,以及他们在哪一步停下。AI 负责把噪音压低,让团队把时间花在验证事实、展示方法和解决真实阻力上。