优先选那些能区分“问题出在页面本身”还是“问题出在测量条件”的页面,而不是随机抽样或只测首页。一个可操作的判据是:样本里至少包含一个已知改动过、一个长期未动、一个结构最重、一个结构最轻的页面,先看它们在同一测量条件下是否给出方向一致的结果。
额度有限时,常见局面是几个人各自测了几个页面,然后拿着不同结论开会。运营说“整体还行”,前端说“慢得离谱”,第三方合作方说“我这边打开很快”。分歧往往不在数据本身,而在于每个人测的页面、网络位置和等待时机不同。把分歧转成可核对的项目,第一步不是继续加测,而是先确定样本要回答哪个问题。
如果样本里全是首页和落地页,你只能回答“门面快不快”;如果全是后台重交互页,你只能回答“应用层重不重”。两种样本都成立,但回答的不是同一个问题。额度越少,越要让样本服务于一个明确判断,而不是求覆盖全面。
面对“有的页面快、有的页面慢”,通常有两种解释,必须先分开。
两种解释对应的下一步完全不同:前者要改页面,后者要改测量方法。额度有限时如果混在一起测,最后既改不动页面,也说不清方法。
要让样本有信息量,就要让“页面”成为唯一变量。具体做法是:
一个假设例子:某站点有 A、B、C 三个页面,A 刚改过图片加载方式,B 长期未动,C 是结构最重的页面。在统一条件下测完,如果 A 明显优于 B、C,且 B 与 C 的差距符合结构预期,那么“页面差异”这一解释得到支持,下一步可以优先把 A 的做法推广到 C。如果三个页面读数接近,但换一台设备后差异突然变大,那更可能是测量条件在起作用,下一步应先固定设备档位,而不是急着改页面。
挑选样本时,可以按下面这个顺序分配有限的查询次数:
每测完一组,先记录“读数是否稳定复现”。如果同一页面重复测量波动很大,说明当前测量条件还不够受控,此时继续加测新页面只会放大噪声,应该回到条件统一这一步。这个动作会直接影响下一步:稳定复现的样本才值得扩样,不稳定的样本应先解决测量问题。
额度紧张时,有几类页面应尽量排除,除非它们正是你要回答的问题:
排除它们不是因为这些页面不重要,而是因为它们会把“页面差异”和“条件差异”搅在一起,降低小样本的判别力。把有限的额度留给能区分解释的页面,才是信息量最高的用法。