PanHunt 怎么给网盘搜索工具打分
7 个维度,机器跑 20% 人判断 80%。不是最科学的方法,但是目前能想到最诚实的方法。
有人问:你们给工具打分靠不靠谱?会不会收了钱就放水?
这问题得正面回答。评测站的信誉,靠的就是把打分过程摊开给人看。
7 个维度,机器和人各管一摊
总分 5 分。机器部分占 1 分(20%),人工部分占 4 分(80%)。为什么人占这么大比例?因为机器测不出广告有多烦人、搜出来的结果到底有没有用。
机器测的
网络连通性。拿阿里云拨测跑首页的平均响应时间。400 毫秒以内 5 分,超过 2 秒 0 分。
页面性能。Google PageSpeed Insights 的 Core Web Vitals。手机和桌面各测一遍,此网址和源站再各测一遍——4 个结果取平均。通过得 5 分,不通过 0 分。
人测的
资源丰富度——占人工部分 60%,是权重最高的一项。从豆瓣"选电影"和"新片榜"各取 3 个热门电影名、从"选电视剧"取 3 个热门剧名,去重后凑齐 9 个关键词。逐一在待测工具中搜索,搜到有效资源记 1 分,搜到没资源的记 0.5,搜不到 0。9 个关键词总分 × 5/9 就是最后得分。
广告干扰度——占 10%。从首页到完成一次搜索并进入详情这条链路上,统计经过的页面数和出现的广告数。平均每页 0 个广告 5 分,超过 4 个 0 分。额外惩罚:如果核心链路上有任何一页的广告超过 4 个,最终得分还要乘以 (1 - 该页占比)。
使用便捷性——占 10%。直接打开就能用 5 分,需要关注公众号 3 分,需要注册登录 2 分,付费但有免费额度 1 分,纯付费 0 分。
搜索响应速度——占 10%。浏览器开发者工具里看一次完整搜索的 Load 耗时。1 秒内 5 分,8 秒以上 0 分。
主观体验——占 10%。不好量化的部分归到这里。界面好不好看、操作顺不顺手、有没有反人类的交互。满分 5,就是我自己的使用感受。
举一个例子
假设测一个工具,网络响应 417 毫秒→4 分。PageSpeed 的手机此网址不通过、手机源通过、桌面全通过→(0+5+5+5)/4=3.75 分。机器部分=(4+3.75)/2×50%×20%=0.3875 分。
人工部分假设 9 个关键词搜出 6 个有效、2 个空结果、1 个搜不到→(6×1+2×0.5+0)/9×5=3.89 分。广告平均每页 2.33 个→2 分,但首页有 5 个广告算超高密度→2×(1-1/3)=1.33 分。不需要登录→5 分。搜索耗时 1.5 秒→4 分。主观体验给 3.5 分。
人工部分=(3.89×0.6+1.33×0.1+5×0.1+4×0.1+3.5×0.1)×80%=(2.334+0.133+0.5+0.4+0.35)×0.8=2.97 分。
总分=0.39+2.97=3.36 分。没有达到 4 分的推荐线,外链加 nofollow。
说明几件事
这个评测方法有几个地方不够理想:
-
9 个关键词都来自豆瓣热门榜单,偏向影视内容。如果你主要搜文档、软件、学术资源,分数参考价值打折。
-
网络测试用的是阿里云国内节点。如果这个工具的服务器在海外、主要用户也在海外,测出来的延迟偏高但实际用户可能不觉得慢。
-
主观体验分就是我一个人的感受。我觉得好看的你可能觉得丑,我觉得顺手的你可能觉得别扭。这是没法量化的事情。
-
评测结果会过期。工具改版、换域名、加广告、性能优化——任何变化都会影响分数。所以每个工具都标了"最近检查"日期。
分数和人,你更信哪个
我写这么多,不是想说这个评测体系有多科学。它是目前我能想到相对诚实的方法:把打分规则公开、用固定流程测、结果随时复查。
但最终——你用着顺手的工具就是好工具,不管它在我这儿几分。如果评测说一个工具 4.5 分但你用着很烦,那是评测的问题。
有人问为什么不搞用户评分。想搞。让更多人的使用感叠加进来,比一个人的评测靠谱。这是接下来要做的事情。