数据分析45 分钟

A/B 结果用 AI 整理:假设、数据、结论、下一步

A/B 跑完了,别再说「B 好像高一点」。把假设、样本量、置信区间和下一步整理成一页读报,让 AI 只算不拍板,上线还是再跑一轮由你决定。

A/B 测试假设管理数据分析置信区间可复制提示词

适合人群

刚接触 AI、负责产品/营销落地页和活动 A/B 测试、要写测试结论给老板拍板的数据分析或运营新人

先解决什么

A/B 测试跑完手里只有两个转化率,说不清当初假设、样本够不够、结论成不成立、下一步该上线还是再跑一轮。

学完结果

一份可直接发的一页 A/B 读报:假设回顾、关键数据、统计结论、下一步行动,每条动作都带负责人和截止时间。

你会学到什么

先写假设再跑数,AI 只整理你不改写目标

结论必须带样本量、差幅和置信区间下限,只看转化率会误判

AI 只给三选一动作:上线、不下线、再跑一轮

临时投放和混跑流量要单独剔除,统计显著不等于业务值得上线

开场困境

版本 B 转化率更高,但我不敢说它赢了

周三早上,A/B 测试跑了 7 天,你打开后台看到 B 版落地页转化率 3.4%,A 版 2.8%,心想:B 赢了。可当老板问「能全量上线吗」,你突然答不上来——样本够不够、差距是不是运气、要不要再跑一周,你一个都没把握。

A/B 结果不是「哪个数字高哪个赢」,而是一份能回答四件事的读报:当时假设是什么、原始数据是什么、结论成立到什么程度、下一步具体做什么。

错误做法

把两个转化率丢给 AI,它只会替你拍板

最常见的错误,是把「A 2.8%、B 3.4%」一行字丢给 AI,问它哪个版本好。AI 会立刻回你「B 版本表现更优,建议上线」,但它不知道样本量只有 300、不知道新老用户有没有混跑、更不知道你当初的假设是「提高注册转化」而不是「让页面更好看」。

反例:只给两个转化率就让 AI 判断胜负,AI 输出「B 明显更优」,但两组样本各只有 150 人,统计上根本不够。

反例:没写原始假设,AI 把结论写成「新版视觉更清爽」,和「提升注册转化」的目标对不上。

反例:没说新老用户分流规则,AI 把混在一起的人群当成同一个整体,结论被新用户拉高。

反例:AI 建议「立即全量上线」,你照做了,但置信区间下限接近 0,两周后效果回落,回退成本高。

实操流程

5 步把 A/B 结果压成一张能拍板的读报

输入样例:把下面这段原样整理好再贴给 AI——测试目标:提升落地页注册转化率;原始假设:把首屏按钮从橙色改为蓝色,预期注册转化率从 2.8% 提升到 3.2% 以上;测试时长:7 天;分流:按 user_id 随机 50/50;A 组旧版 6,000 访客、168 转化;B 组新版 6,000 访客、204 转化;显著性水平 0.05。

  1. 先写一行假设:测试想解决什么问题、预期升到多少。没有假设,结论就是摆设。
  2. 把原始数据抄成固定格式:组别、访客数、转化数、时长、分流规则,一条一行,别在抄的时候替 AI 下结论。
  3. AI 只输出四栏:假设回顾、关键数据、统计结论、下一步行动,并明确禁止编造样本量和置信区间。
  4. 单独要求 AI 列出三个统计量:两组样本量、差幅、95% 置信区间下限,缺一个就视为没算完。
  5. AI 的结论翻译成三选一动作:上线、不下线、再跑一轮,每条动作带负责人和时间。

案例

同一组数据,AI 给出的是「可再跑」不是「立即上线」

输入:沿用上面的输入样例。AI 输出:假设回顾——目标是提升注册转化率,预期从 2.8% 提升到 3.2% 以上。关键数据——A 组 6,000 访客、168 转化(2.80%);B 组 6,000 访客、204 转化(3.40%);差幅 +0.60 个百分点。统计结论——95% 置信区间下限为 +0.12 个百分点,p 值 0.046(<0.05),B 在统计上优于 A,但下限离 0 很近,显著性偏弱。下一步——建议再跑 7 天,同时把周六临时投放带来的 1,200 个访客单独剔除复核;若结果稳定,再全量上线 B 并保留旧版作为回退开关。

你没盲从「B 赢了」,而是把临时投放的流量剔除后重算,发现自然流量里的差幅缩到 +0.3 个百分点,结论从「立即上线」变成「再跑一周确认」。这一步就是 AI 帮不了你、必须人工把关的地方。

可复制提示词

直接复制这条提示词

把下面这段和你的 A/B 数据一起发给 AI,它只整理不拍板,并把缺的信息单独列出来。

A/B 结果读报提示词AI 按假设、数据、结论、下一步四栏整理 A/B 结果,先算统计量再给动作,禁止编造。
你是一名数据分析助理。下面是我跑完的 A/B 测试原始信息,请按四栏输出一份读报:1.假设回顾:重述我的测试目标和原始假设,不要改写;2.关键数据:列出两组样本量、访客数、转化数、转化率和差幅,只能使用我提供的数据;3.统计结论:给出显著性水平、p 值或置信区间,并判断是否达到显著;如果数据不足,直接写【数据不足】,不要编造 p 值;4.下一步行动:只给三选一——上线、不下线、再跑一轮,每条动作带负责人和截止时间,没有就写待定。规则:只使用我提供的数据,禁止编造用户反馈、行业基准或额外样本;最后单独列一栏【人工待核】,标出你会需要但没给的信息。

测试目标:[一句话]
原始假设:[预期提升到多少]
测试时长:[天数]
显著性水平:[例如 0.05]
分流规则:[例如按 user_id 随机 50/50]
数据:A组|访客数|转化数;B组|访客数|转化数

人工检查

发给老板前,过一遍这六项

假设是不是我写的原始目标?AI 有没有偷偷改成「页面更好看」这类无法验证的话。

两组样本量写清了吗?有没有 9:1 这种严重不均衡的分流没说明。

置信区间下限出现了吗?只看 p 值会漏掉「显著但幅度很小」的风险。

结论里有没有我数据里没有的东西?「用户更喜欢蓝色」这种话就是编的。

下一步是不是三选一:上线、不下线、再跑一轮?「继续优化」不算动作。

有没有检查混入临时投放、新老用户混跑等污染源?有就单独剔除复核。

可直接套用的流程

1. 先写清楚任务目标:这次要让 AI 帮你完成什么工作,而不是泛泛地问一个问题。

2. 再给资料边界:哪些背景、数据、约束、口径必须被使用,哪些内容不能编。

3. 最后规定输出格式:用清单、表格、方案、话术还是复盘报告,并保留人工检查。

继续看相关教程