一份清单只有在按依赖关系排序时才有价值,而技术类项目之间的依赖尤其重。下面十项里有四项,一次命令行抓取就能定论。三项需要一个月的服务器日志留存,以及一个会查日志的人。还有三项根本不是修复:它们是关于“你希望别人的机器能读到什么”的决策。按这个顺序跑不是为了整齐,而是因为只有这个顺序下,结果才有意义。
依赖只朝一个方向流。如果一次普通抓取返回的是一道挑战而不是页面,那么之后你看的每一份日志都会是沉默,而这份沉默的原因跟引擎对你有没有兴趣毫无关系。如果 robots.txt 禁掉了搜索侧令牌,一个月的抓取数据读起来就像冷淡,团队于是得出“AI 引擎不关心我们这个品类”的结论,而事实是站点自己让它们别来。如果正文只在水合之后才存在,那么一次引用率测量测的是 JavaScript 包,而不是文字。这三种都是长得跟真阴性一模一样的假阴性,所以清单靠上的失败是一条“停止”指令,而不是一条留着以后再说的备注。
成本指向同一个方向。第一层是一台笔记本加十分钟。第二层要占一个人一天,还需要你未必有的日志留存。第三层要开一次会。便宜的检查为贵的检查把关,因此对第一层失败的正确反应是:修掉它、等厂商系统跟上、再从头跑一遍,而不是往下硬推。每一项背后的道理都在它自己的文章里,并从该项目直接链出;这一页新增的是顺序和执行方式。