每个管理好的QA供应商,包括我们,都声称会写出"好"的Playwright测试.
这种说法几乎无一可以衡量。
于是我们建造了一个不取任何人之词的计分器——一个开源的,决定性的,无AI的工具叫剧作家分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分分 结果:1,214个 spec文件,5,943个测试,168,902行测试代码,以及5,467个个人规则被违反,在2026-08-19上以每个项目的活分/分.
这篇文章的每一个数字都可以从一个单一的脚本中复制出来,反对所有链接的公众重置——没有调查,没有自报的数据,没有来自我们自己的客户的任何数据.
标题编号17 公共重播 5 467 规则被违反 发现30.1% 所有定位器是原始 CSS/XPath 12 / 17 重播 测试 零断言 炸弹 我们选择回购不是为了使工具——或行业——看起来好或坏.
教体混合了被大量设计的平台(Supabase, Grafana, Mattermost, n8n),与通过搜索真实用途找到的更小而不太成熟的项目相混合.
每个回放都通过新鲜的,浅薄的,稀少的克隆——没有任何东西是出售的或缓存的,在持有其Playwright套件的确切子目录上打分.
Repo 分数等级文件测试结果 Playwright( 属于 TodoMVC 实例) 98/100 A 24 4 Supabase 98/100 A 31 271 167 免费CodeCamp 97/100 A 89 372 187 Documenso 96/100 A 125 1109 579 故事手册 96/100 A 6 25 12 dub 96/100 A 17 147 27 n8n 95/100 A 256 1047 39 novu 93/100 A 2 3 Grafana 92/100 A213 672 744 PostHog 91/100 A 42 124 261 Immich 90/100 A 13 43 Matestimmerest 90/100 A 284 1157 1476 sencho 90/100 A 26 177 263 cal.com 85/100 B 278 1215 开放玩家77/100 C 777 36 The CyberHub 73/100 C 11 138 275 运行于2026-08-19 以游玩-right-sco 在GitHub Repo中用剧本/validate-corpus.sh自己重写.
真正的"Playwright"套房到底有什么问题,"Grades"隐藏了有趣的部分.
我们还保留了每一个个人的发现——其中5 467个——并排在具体反标者最常出现在整个调查官身上的名次。
这是没有在我们工具的登陆页上的部分。
规则事件 重置影响 3,287 16 / 17 Raw page.locator ()/frame.locator () CSS 或 XPath 而不是基于角色的定位器 572 8 / 17 Legacy page.
点击(selector) 样式而不是 Locator API 450 / 17 硬码睡眠 (Waititimout) 219 12 / 17 不自动重置对活的 DOM 194 8 / 17 等ForLoad State ('networkidle') ——在 Playwright 144 9 / 17 绕行可操作性检查中不可靠 103 8 / 17 Manual wait ForSelector 而不是自动等待 102 12 / 17 A测试区块,运行和通过时不主张任何东西 71 10 17 spec spec 大小到损害可审查性,维持 70 3/ 17 17 等待作为 ync Playwright 调用—— 两种模式支配着其他一切。
在5 467项总调查结果中,定位人反标占4 067起——74%是每起侵犯事件——仅所有调查结果的60%,在17起重案调查中有16起。
这不是个小错误。
这是大多数团队仍然写作"Playwright"选择器的默认方式,在"Playwright"自己的docs开始推荐基于角色的定位器于生CSS后三年.
逐一逐一逐一逐一逐一逐一逐一逐一列出,其中17 118个,69.9%以角色为主,30.1%为原始选择者。
两个回放在被体中,活代码和开放玩家j,使用零角色定位器:两个套房中每个单位定位器都是生的CSS或XPath选择器.
两者都未能实现默认阈值.
一个B级的套房可以隐藏更多的发现而不是A Cal. com的套房只触发了53个文件的1,215个个人发现——大约每个文件23个,是本体中密度最高的——仍然得分85分(B)分,超过了默认阈值.
最关键的,反之