先别急着扩大批量。把试做与批量交付拆成两条线,各抽一批可复核样本,对比同一批页面的交付物、变更痕迹和结果波动;如果差值集中在某几个批次或某类页面,先按批次整改并压小交付量,只有当差值分散且原因不可定位时,才考虑退出。抽查的目的不是给外包方打分,而是判断问题属于执行波动、标准漂移,还是原本就不适合规模化的做法。
试做阶段通常只做少量页面,样本少、关注多、修改轮次也更多,表现好并不奇怪。批量后变差,可能来自三种完全不同的原因:一是交付标准没有被写成可执行规则,换人执行就漂移;二是试做时选的是容易做的页面,批量后覆盖了难度更高的词和模板;三是抽查方法本身变了,比如试做时逐条人工看,批量后只看汇总数字。
要区分它们,先固定抽查口径:同一类页面、同一套检查项、同一时间窗口。抽查项建议只保留能留下痕迹的几项,例如标题与首段是否覆盖目标意图、正文是否出现与主题无关的填充、内链是否指向相关页面、页面是否出现重复模板段落。每项记录“通过、需改、缺失”三种状态,不要只记一个总分。
如果试做批次和批量批次用的是不同检查口径,先统一口径再比较,否则任何结论都不可靠。这一步的动作是:把试做样本重新按新口径查一遍,得到基线。基线出来之后,才能判断批量批次是真的下滑,还是原本就被高估。
批量交付变差最常见的形态不是整体崩掉,而是少数批次明显拖后腿。按批次抽查比按总量抽查更能定位问题。做法是从最近若干批次中各抽固定数量页面,例如每批抽相同页数,记录每批的需改率和缺失率,再看这些比例是均匀分布还是集中在某一两批。
这里有个容易踩的坑:把请求量、抓取量或某个统计指标的短期下滑直接当成外包质量差的证据。抓取量下降也可能来自站点自身调整、发布节奏变化、页面被合并或索引策略变动。这些现象只能作为线索,不能单独证明处理是否正确,必须和页面级交付物对照才有意义。
假设试做阶段做了20个页面,批量阶段每批50个页面,共4批。把试做的20个页面按新口径重查,得到基线需改率为20%。再对4个批量批次各抽20个页面,得到需改率分别为22%、25%、48%、51%。
这个结果指向的不是“外包不行”,而是后两批出现了明显漂移。下一步动作是:暂停第3、4批的继续交付,要求对方只对这两批做返工,同时提供这两批的写作说明和检查记录。返工后重新抽同样数量的页面,如果需改率回到接近基线的水平,可以恢复交付但把每批规模压小;如果返工后仍集中在同一类问题,则说明这类页面不适合继续外包。这个例子里的数字只用于说明比较方法,不代表任何真实项目的水平。
三种取舍各有前提,不必都选。
保留适用于:漂移集中在少数批次,返工后能回到基线,且你能提供稳定的页面模板和检查规则。此时的动作是把抽查固化成每批必查,并约定返工责任,而不是加量。
改写适用于:问题出在交付标准本身,比如试做时的好表现依赖个别写手的判断,无法复制。此时的动作是把可复用的部分写成规则,例如哪些段落必须出现、哪些表述要避免、内链指向哪类页面,然后用一个小批次验证规则是否真的可执行。规则验证不通过,就不要急着放大。
退出适用于:返工后同类问题反复出现,或对方无法提供可核对的交付记录,导致你无法判断问题出在哪。此时的动作是停止新增批次,保留已有页面的处置权,把剩余页面收回自做或换一种交付方式。
无论选哪种,抽查结果都应该落到下一步动作上:通过则维持当前批量,需改则限定返工范围,缺失则缩小外包边界。抽查本身不产生结论,只有把结论接到具体动作上,才不会下一批继续踩同一个坑。