跳到正文
YibudYibud

在一个百分比变成结果之前

烟雾测试要多少访客才够——把转化率读成区间

单独一个百分比不是判决。“烟雾测试要多少访客才够?”问的是精度:小样本会给出很宽的、仍然说得通的真实转化率范围。上线之前先写:谁算匹配访客、转化事件是什么、通过线、失败线、固定的 N,以及通过 / 未过 / 无法判定时各做什么。然后把 n 个访客里的 k 次报名读成区间——不是“我们有 5%”。

最近更新:2026年10月6日

直接回答

烟雾测试要多少访客才够?

够把报名率对照事先写好的线,读成一个区间——不够“验证”点子。把 n 个匹配访客里的 k 次转化读成 95% Wilson 区间,而不是只看 k/n。同样观察到 5%,100 个访客是 2.2%–11.2%,200 个是 2.7%–9.0%,400 个是 3.3%–7.6%。零转化也是信息:n 次里一次都没有,95% 置信下真实转化率大约不超过 3/n(0/100 → 约 3%;0/300 → 约 1%)。上线前固定 N;图看起来好看的那一刻不要停。

要记住的

带走这五句

  • 烟雾测试不是 A/B 测试。你是在用事先写好的通过线和失败线,检查一个转化率。
  • 把 n 个匹配访客里的 k 次转化读成 95% Wilson 区间,而不是一个单独的百分比。
  • 上线前写好三向规则——明确未过、明确通过、无法判定——并为每一种点名动作。这是 Yibud 建议的模板,不是统计定律。
  • 零事件也是信息(3/n 法则(rule of three))。不匹配的点击会把区间收在错误的数字周围。流量质量胜过更大的 N。
  • 通过的报名率是兴趣证据,不是钱。通过之后,下一步通常是付费意愿测试。

为什么要做

单独一个百分比,会让创始人一直开着测试,而不是做决定

常见的情况是:在混杂点击之后,把“我们有 5%”当成判决,某一天曲线难看就把失败线往后挪。这个数字从来不会告诉他们点子会成功。它只能告诉他们:仍然说得通的真实转化率,范围有多宽。Brown、Cai 与 DasGupta(2001)表明,教科书里的 Wald 区间——p ± 1.96 · sqrt(p(1−p)/n)——覆盖率反复无常,比课本暗示的更差。他们建议:n 较小(40 及以下)用 Wilson 区间或 Jeffreys 区间,更大的 n 用 Agresti–Coull 区间。Wilson(1927)是得分区间的来源。先定数字,再看结果。热闹的一个下午之后发明的转化率,是复盘。

用语

上线前这七个字段是什么意思

这一页不是“等到感觉流量够了”。它是一份写了日期的合同:谁算数、什么算转化、通过和失败落在哪、你能接受多宽的区间、固定的 N,以及测试进行中你不会做的事。

1. 匹配访客——这个转化率在说谁

匹配访客符合你上线前点名的角色和来源。错误职位的随机点击要丢掉,不要平均进去。不匹配的流量,会把区间收在并不属于你顾客的转化率周围。

2. 转化事件——你要数的那一个动作

等候名单、回复,或一笔你真能退的定金。点标志不算。两个按钮会拆散信号。用陌生人也能打分的一句话写下事件。

3. 通过线——让你愿意继续的转化率

如果它站得住你也能接受的数字,第一个访客到来之前写好。“有意思”不是一条线。本页不会给你发明“典型创业转化率”。

4. 失败线——让你停或改写的转化率

第二个数字,同样在上线前写好。失败线通常低于通过线。只有一条线,每个混乱的星期都会变成故事。

5. 置信区间——仍然说得通的转化率范围

这里指 n 次试验里 k 次事件的 95% Wilson 得分区间(z = 1.96)。它是仍然说得通的真实转化率范围,不是对下一百个访客的承诺。它也不是 Yibud 引擎分数。

6. 固定 N——你要等多少个匹配访客

上线前写好 N。可选:一次事先声明的检查点加上限(只延长一次,然后停)。图已经好看了再去选 N,不行。边看边停,已经不是你写下的那次实验。

7. 偷看——因为好看就停

Evan Miller(2010)写 A/B 测试时指出:显著性假定样本量事先固定。一显著就停,会抬高假阳性。他最坏的例子——最多观察到 150 就每次都检查,基础率 50%——假阳性是 26.1%,而不是 5%。偷看 10 次,报告的 1% 显著性实际上大约是 5%。这个教训可以搬到单转化率的烟雾测试:先固定 N,再读。

证据

这些论文和文章实际量了什么——以及没量什么

这些是已发表的发现,按原样标注。它们不是对你个人的预报,不是典型报名率,也不是 Yibud 规则。本页没公布的转化基准,不要自己搬进来。

Wilson(1927)——本页使用的得分区间

Edwin B. Wilson,《Probable Inference, the Law of Succession, and Statistical Inference》,Journal of the American Statistical Association 22(158):209–212(1927)。Wilson 得分区间的来源。下表使用 95% 的该区间(z = 1.96)。数字是计算示例,不是 Yibud 的实测结果。

Brown、Cai 与 DasGupta(2001)——小样本为什么不用 Wald 区间

《Interval Estimation for a Binomial Proportion》,Statistical Science 16(2):101–133。标准 Wald 区间(p ± 1.96 · sqrt(p(1−p)/n))覆盖率反复无常,比课本暗示的更差。作者建议:n 较小(40 及以下)用 Wilson 或 Jeffreys,更大的 n 用 Agresti–Coull。所以本页用 Wilson 读烟雾测试转化率,而不是创始人课堂上记得的正负公式。

Hanley 与 Lippman-Hand(1983)——什么都没发生时的 3/n 法则(rule of three)

《If Nothing Goes Wrong, Is Everything All Right? Interpreting Zero Numerators》,JAMA 249(13):1743–1745。n 次里一次事件都没有,95% 上限大约是 3/n。n > 30 时,这个近似与精确计算在四舍五入到百分点后一致。他们的情境是医学(零不良事件)。同样的数学适用于零报名:0/100 → 约 3%;0/300 → 约 1%。本页的精确(二项)零事件上限 1 − 0.05^(1/n):n = 100 → 2.95%;n = 300 → 0.99%。这不是 Wilson 上限——0/100 的 Wilson 上限是 3.7%(见表)。零是信息,不是“没有数据”。

Evan Miller(2010)——偷看会抬高假阳性(A/B 语境)

《How Not To Run an A/B Test》(2010-04-18)。显著性假定样本量事先固定。一显著就停,会抬高假阳性。该文最坏的例子:最多观察到 150 就每次都检查,基础率 50%,假阳性 26.1% 而不是 5%。偷看 10 次,报告的 1% 显著性实际上大约是 5%。他的建议:事先决定样本量。把来源标成 A/B 测试语境。搬到烟雾测试,是同一个习惯:报名曲线看起来好看的那一刻不要停。

你可以采用的三向规则——上线前写好,不是定律

Yibud 建议的模板,不是统计定理:整个区间都在通过线之下,算明确未过(连乐观读法都没过)。观察到的转化率不低于通过线,且区间下端高于失败线,算明确通过。其余都是无法判定——做上线前点名的那一个动作(延长一次到上限,或按未过处理)。看到 6/200 之后,不要发明更宽厚的区间。

不是同一页

样本量 vs 怎么跑、访谈次数、付钱、产品市场契合问卷、选测试、合同和分数

Yibud 好几页挨着本页。混在一起,就会把落地页搭建、饱和次数,或中段引擎分数,变成“访客够了”。

烟雾测试、落地页、假门——怎么跑,不是怎么定样本量

那些页是实验本身:页面、那一个行动号召、渠道、诚实的等候名单。本页是要等多少个匹配访客,以及如何把 k/n 读成区间。上线的页面不是样本量合同。落地页指南里 200–500 访客的经验法则,本页并不推翻——这里只说明 200 能告诉你什么、不能告诉你什么。

客户访谈做多少次——覆盖,不是转化区间

那一页的信号是:同一细分的一批还是否会加上新的需求编码。本页的信号是一个访客转化率的精度。饱和不是 Wilson 区间。区间也不是访谈覆盖。

客户访谈做多少次才够 →

付费意愿——钱在动,不是报名率

通过的烟雾测试转化率是兴趣。它不是定金、结账或标了价的管家服务。通过之后,转到付费意愿页。不要把一封邮件当成价格。

付费意愿测试 →

产品市场契合问卷——当前用户的使用,不是访客转化

那一页的信号是:最近有真实使用的人里,产品消失会非常失望的百分比。本页的信号是 n 个匹配访客里的 k 次报名。Sean Ellis 的百分比不是落地页转化区间。

产品市场契合问卷 →

最便宜的验证测试——选哪个测试,不是做多大

那一页为你真正的未知挑选最便宜的工具。本页是在工具已经是烟雾测试之后,给它定样本量。方法选择器不是一个 N。

最便宜的验证测试 →

停止、转向、假设、决策——以后能读这条规则的合同

那些页写停止、改一个维度、点名一条主张,或读取你已经有的一周证据。本页提供那些合同以后能读的一种输入:对一个转化率、写了日期的通过 / 未过 / 无法判定。它不是一次停止 / 转向 / 继续的会议。

Yibud 分数——不是转化率,也不是置信区间

验证分数含义页和分数计算器页解释的是 Startup MRI 的数字,来自确定性引擎,输入是一句话点子加五个问题。那些分数是照向假设的手电筒。它们不是报名率,也不是 Wilson 区间。不要把中段分数读成“访客够了”,也不要把 10/200 读成 Yibud 的放行。

这一坐

如何在一次坐下来写好并遵守样本量合同

页面公开之前做。定个计时器。字段填完之前,广告先别开。如果有联合创始人,各自先写一稿,然后留下更紧的访客定义。

  1. 1

    任何人能点之前,先写合同

    匹配访客、转化事件、通过线、失败线、固定 N、可选的单次检查点加上限,以及通过、未过、无法判定时的具名动作。任何一个字段是空的,你就还没准备好买流量。

  2. 2

    定义匹配访客,让陌生人也能给日志打分

    角色加来源。“从一篇点名的社群帖进来的美国独立簿记员”是访客定义。“流量”是一场发布会。其余丢掉。混杂垃圾上的紧区间,仍然是垃圾。

  3. 3

    把通过、失败和三向动作写在同一页

    Yibud 的模板,不是定律:整个区间低于通过线,算未过;观察到的转化率不低于通过线且下端高于失败线,算通过;否则无法判定 → 你已经点名的那一个动作。不要再加第四种结果叫“有希望”。

  4. 4

    固定 N——可选检查点也要在上线前决定

    按你需要的精度选 N,不是按能写成帖子的数字。下表显示同样 5% 在 100、200、400 时会怎样。如果允许延长一次,现在就写下检查点和上限。周五发明的第二次延长,是偷看。

  5. 5

    跑测试时,好看也不要停

    Miller 的 A/B 测试文章是警告:边看边停会抬高假阳性(他最坏的例子里是 26.1% 对 5%;偷看十次,报告的 1% 实际上大约是 5%)。搬过来:等到你写下的 N,再读。跟踪来源。一个真实的渠道,胜过三个你叫不出名字的。

  6. 6

    把 k/n 读成区间,然后当天做具名动作

    查表,或用表格软件算 Wilson。遵守未过、通过或无法判定。通过是兴趣,不是收入——下一步通常是付费意愿。不要宣布点子已被验证。

你带走什么

烟雾测试样本量合同(直接抄)

如果这一坐只产出了心情,你就还没做完。这一页应该有一条陌生人也能执行的填好的规则。填空。不要留下“用户”“流量够了”或“看到就知道”。

样本量规则

匹配访客:[角色 + 来源——不是“流量”]。转化事件:[那一个动作]。通过线:[例如 5%]。失败线:[例如 1%]。固定 N:[例如 200 个匹配访客]。可选检查点 + 上限:[事先声明的一次延长 / 无]。明确未过时的动作:[停 / 改写方案 / 杀掉这条假设]。明确通过时的动作:[点名的下一步——通常是付费意愿]。无法判定时的动作:[延长一次到上限 / 按未过处理]。

如果任何一个括号里还写着“访客”“有意思”或“以后”,合同就还没写好。两个岗位的点击不共享一个 N。恭维不是转化。

什么不算这个信号

不是这个信号:Yibud 分数、一句恭维、“我会用”、Sean Ellis 的非常失望百分比、访谈饱和、定金或结账(那是付费意愿页)、对上 Blank 的五条、签了的设计合作伙伴、Nielsen 的 5 个可用性用户。以后可选:那些工具有自己的页。

你仍然可以记下赞美或钱。你不能让它们触发这条样本量规则。触发规则的,是 n 个匹配访客里的 k 次转化——读成区间。

起步规则示例(模板——线是你填的,区间算法不是)

匹配访客:[点名的角色 + 一个渠道]。事件:邮件等候名单。通过线:5%。失败线:1%。固定 N:200。不偷看。明确未过:整个 95% Wilson 区间低于 5%。明确通过:观察转化率 ≥ 5% 且下端 > 1%。无法判定:延长一次到 400,若仍压在通过线两侧则按未过。通过后的下一步:点名的定金测试。

模板里的 5% 和 1% 是你填的空,不是行业基准。本页不发明典型转化率。表里的区间数字是算好的 Wilson 示例(z = 1.96)。

这些数字

k 除以 n 实际能告诉你什么(Wilson 95%,z = 1.96)

计算示例。不是实测结果,不是 Yibud 分数,也不是对创业落地页通常怎样的宣称。请按表上印出的值使用。

若干烟雾测试结果的 Wilson 95% 区间
观察值(k/n)观察转化率95% Wilson 区间
0/500%0%–7.1%
0/1000%0%–3.7%
0/2000%0%–1.9%
1/502%0.4%–10.5%
2/1002%0.6%–7.0%
3/1003%1.0%–8.5%
5/1005%2.2%–11.2%
2/2001%0.3%–3.6%
6/2003%1.4%–6.4%
10/2005%2.7%–9.0%
20/4005%3.3%–7.6%
5/5010%4.3%–21.4%
10/10010%5.5%–17.4%

同样观察到 5%,100 个访客是 2.2%–11.2%,200 个是 2.7%–9.0%,400 个是 3.3%–7.6%——N 变成四倍,宽度大约减半。零事件的精确(二项)上限 1 − 0.05^(1/n),用来对照 3/n 法则(rule of three):n = 100 → 2.95%;n = 300 → 0.99%。这不是 Wilson 上限——0/100 的 Wilson 上限是 3.7%(见表)。3/n 法则(rule of three)(Hanley 与 Lippman-Hand):n 次里 0 次,95% 下大约不超过 3/n(0/100 → 约 3%;0/300 → 约 1%)。

Wilson 公式,只用纯文本写一次

n 个匹配访客里有 k 次报名,令 p̂ = k/n,z = 1.96。95% Wilson 区间是 [p̂ + z²/(2n) ± z · sqrt(p̂(1 − p̂)/n + z²/(4n²))] / (1 + z²/n)。

任何表格软件都能算。本页不提供交互计算器。不想算,就用表。

分岔

什么时候样本量是最贵的未知——什么时候不是

本页只决定:现在该不该为“这个 N 能告诉我一个转化率的什么”去买证据。怎么搭页面、访谈覆盖、付钱、使用问卷、选哪个测试、决策合同,各有自己的页。

先写区间合同

你已经知道怎么把页面挂上去。最贵的未知是 N 能告诉你什么。写下七个字段。然后再买或去要流量。

先搭或先选测试

你还没有页面、行动号召,或这个工具为什么胜过访谈的理由。用烟雾、落地页、假门或最便宜测试那一页。没有测试的 N,是一张电子表格。

先转到钱

通过已经触发,或未知已经是他们会不会付钱。用付费意愿页。更多不收费的访客不会让钱动起来。

什么时候烟雾测试样本量规则是最贵的未知

你能点名匹配访客和转化事件。你还没写 N、通过线、失败线或无法判定时的动作。你正准备从一个很小的 n 读出一个百分比。那就是本页。Yibud 报告上偏弱的分发或需求那一行,靠近这个分岔——当作手电筒,照出烟雾测试该瞄准哪条假设,而不是当作一个 N。

什么时候烟雾测试样本量规则是错误的下一步

你叫不出谁算数。你还在问“你会用这个吗?”你只需要脚本、对已经做过真事的人做使用问卷、一份稀缺承诺,或一次收费。你把三个渠道混进一个 n。你在对两个标题做 A/B,却把它叫成烟雾测试。去跑那些页。把不匹配的点击跨来源累加,是表演。

演算例子

一份可以抄的区间合同(示意)

下面这一周是示意——名字、产品和次数都是编的,好让你看清设置。它不是研究,不是转化基准,也不是 Yibud 报告。抄方法,别抄故事。区间数字是表里算好的 Wilson 示例。

转化率赌注,第一次点击之前写好

示意名字:创始人陈梅,Ledgerping,给独立簿记员的 B2B 等候名单页。上线前写好的匹配访客:从一篇点名的社群帖进来的美国独立簿记员。转化事件:邮件等候名单。通过线:5%。失败线:1%。固定 N:200 个匹配访客。可选检查点:无。很诱人的下一步是“先看看前五十个怎样”。

2/200——明确未过

观察值 1%,区间 0.3%–3.6%。整个区间都在 5% 通过线之下。连乐观读法都没过。这是你已经点名的未过——停,或改写方案。不是再买两百个“因为文案就差一点点”的理由。

10/200——明确通过

观察值 5%,区间 2.7%–9.0%。观察转化率落在通过线上,下端(2.7%)高于 1% 失败线。这是你已经点名的通过——兴趣,不是钱。动作是点名的付费意愿测试,不是一座工厂。

6/200——无法判定

观察值 3%,区间 1.4%–6.4%。范围压在 5% 通过线两侧。这是无法判定。做上线前写下的那一个动作——延长一次到上限,或按未过处理。看到六封邮件之后,不要发明“有希望”。

为什么 5/100 是脆弱的通过

如果团队只有 100 个匹配访客,看到 5/100(5%,区间 2.2%–11.2%),按模板在技术上算通过:观察转化率落在 5% 通过线上,下端(2.2%)高于 1% 失败线。但这是一次脆弱的通过。区间从不到通过线一半一直拉到 11.2%,真实转化率完全可能远低于 5%。精度远不如 10/200(2.7%–9.0%)或 20/400(3.3%–7.6%)——所以按你需要的精度固定 N,而不是按能塞进日历的数字。

第一次点击之前写好合同。把 k/n 读成区间。遵守未过、通过或无法判定。通过之后,继续推进到下一个最便宜的测试——通常是钱,不是工厂。方法是写了日期的那一页,不是事后讲的故事。

Yibud 放在哪

把免费验证器用作手电筒,然后自己写样本量规则

Yibud 是免费、不用注册的创业点子验证器。分数来自确定性规则引擎,不是语言模型在猜成败。可选的 AI 文字若被使用,只润色文案。它不发明数字。一份 Startup MRI 报告可以点出偏弱的需求或分发维度,再给出第 7 天的继续 / 收窄 / 重测 / 停止信号。样本量工作挨着那条假设——用最弱的维度决定烟雾测试该瞄准哪条主张。不要指望中段分数表示“访客已经够了”。如果你已经有报告,从点名的假设开始写合同——不是从总分开始。然后自己跑测试。即使你从不打开分析器,这套方法也能单独成立。

分析我的点子 →

常见错误

什么通常会浪费样本量规则

图看起来好看就停

Miller 的 A/B 测试文章:显著性假定 N 事先固定;边看边停会抬高假阳性(他最坏的例子里是 26.1% 对 5%;偷看十次,报告的 1% 实际上大约是 5%)。搬过来:等候名单“看起来不错”的那个下午,不要关掉烟雾测试。等到你写下的 N。

把 3/100 读成“3%”

3/100 的观察值是 3%,95% Wilson 区间是 1.0%–8.5%。单独一个百分比会藏起宽度。同样的习惯用在 5/100(2.2%–11.2%),就是团队喊出一个他们守不住的通过。

把不匹配的流量也算进去

错误的人周围收得很紧的区间,仍然是错误的人。跟踪来源。一个真实的渠道。已经喜欢你的朋友和通讯读者会抬高报名——用他们调试页面,然后分开读陌生人。

把零当成“没有数据”

Hanley 与 Lippman-Hand:n 次里一次事件都没有,95% 上限大约是 3/n(n > 30 时,与精确计算四舍五入到百分点后一致)。0/100 → 约 3%;0/300 → 约 1%。本页的精确(二项)零事件上限 1 − 0.05^(1/n):n = 100 时 2.95%,n = 300 时 0.99%。这不是 Wilson 上限——0/100 的 Wilson 上限是 3.7%(见表)。零是结果。

把通过当成付费意愿

一封邮件是兴趣。定金、结账或标了价的管家服务是钱。通过之后,打开付费意愿页。不要宣布产品市场契合。

在很小的 n 上用 Wald 区间

Brown、Cai 与 DasGupta:Wald 区间覆盖率反复无常,比课本暗示的更差。他们建议 n 在 40 及以下用 Wilson 或 Jeffreys,更大的 n 用 Agresti–Coull。课堂幻灯片上的正负号,在五十个访客时,是很差的烟雾测试工具。

来源

这些想法从哪来

一段话

可以引用的摘要

烟雾测试要多少访客,问的是精度,不是证明需求的奖状。上线前写好匹配访客、转化事件、通过线、失败线、固定 N 和具名动作。把 k/n 读成 95% Wilson 区间(Wilson 1927;Brown、Cai 与 DasGupta 2001 警告 Wald 区间覆盖率反复无常,并建议 n 在 40 及以下用 Wilson 或 Jeffreys)。同样观察到 5%,100 个访客是 2.2%–11.2%,200 个是 2.7%–9.0%,400 个是 3.3%–7.6%。零事件也是信息:3/n 法则(rule of three)在 95% 下大约是 3/n(Hanley 与 Lippman-Hand 1983;0/100 → 约 3%)。固定 N;边看边停会抬高假阳性(Evan Miller 2010,A/B 测试语境:他最坏的例子里是 26.1% 对 5%)。Yibud 的三向模板——整个区间低于通过线算未过;观察转化率 ≥ 通过线且下端高于失败线算通过;否则做事先声明的无法判定动作——是模板,不是定律。通过是兴趣,不是钱。Yibud 分数不是转化区间。先写规则再遵守,才是方法。

常见问题

创始人真正会问的

烟雾测试要多少访客才够?

够让 95% Wilson 区间窄到能对照你事先写好的通过线和失败线来读。同样观察到 5%,100 个访客是 2.2%–11.2%,200 个是 2.7%–9.0%,400 个是 3.3%–7.6%。没有哪个 N 能“验证”点子。这些是计算示例,不是定律。

200–500 访客的经验法则是错的吗?

本页并不推翻它。落地页指南写的是 200–500 访客的经验法则。这里要说明的是 200 能告诉你什么、不能告诉你什么:10/200 的 5% 是 2.7%–9.0%;6/200 的 3% 是 1.4%–6.4%,对照 5% 通过线可能无法判定。按你需要的精度写 N。

如果一次报名都没有呢?

零是信息。Hanley 与 Lippman-Hand 的 3/n 法则(rule of three):n 次里 0 次,95% 置信下真实转化率大约不超过 3/n(0/100 → 约 3%;0/300 → 约 1%),n > 30 时近似与精确计算四舍五入到百分点后一致。本页的精确(二项)零事件上限 1 − 0.05^(1/n):n = 100 时 2.95%,n = 300 时 0.99%。这不是 Wilson 上限——0/100 的 Wilson 上限是 3.7%(见表)。0/200 是 0%–1.9%。

转化率已经好看,可以提前停吗?

如果你写了固定 N,不行。Evan Miller 的 A/B 测试文章:显著性假定样本量事先固定;一显著就停会抬高假阳性。他最坏的例子(最多观察到 150 就每次都检查,基础率 50%)给出 26.1% 的假阳性而不是 5%。偷看 10 次,报告的 1% 显著性实际上大约是 5%。事先决定 N。如果想延长一次,上线前写好检查点和上限。

Yibud 分数是转化区间吗?需要账户吗?

不是。Yibud 分数来自对点子输入的确定性规则引擎。Wilson 区间来自 n 个匹配访客里的 k 次转化。你不需要账户。本页的方法可以单独成立。如果你想在写合同前,用手电筒照一照偏弱的需求或分发假设,再跑免费分析器。可选的语言模型文字只润色文案。

第一次点击之前,先写区间合同

Yibud 用确定性引擎给偏弱的需求和分发假设打分。你在还诚实的时候写好匹配访客、事件、通过线、失败线和 N——然后一个百分比才是区间,不是感觉。

生成 Yibud 报告 →