perf(search): compact file name index

This commit is contained in:
chuan
2026-08-11 14:23:15 +08:00
parent 4513aa193e
commit bde079607f
13 changed files with 556 additions and 39 deletions
+4 -6
View File
@@ -22,9 +22,7 @@
- [ ] 在远端真实数据上验证六小时动态状态分桶对 Tantivy 文档重写和删除比例的改善
- [ ] 对比优化前后的每小时索引增长提交文档数和段合并压力
- [ ]下次 Schema 更新中删除已无查询调用方且占真实索引 5.62% 的 `regex_text`
- [ ] 停止在 `aliases` 中重复索引代表标题并验证不同 infohash 的真实别名仍可搜索
- [ ] 使用同一数据集比较文件名 N-Gram `2..8` `2..4` `2..3` 和 Basic postings 的空间查询延迟与误匹配
- [ ]远端真实数据的影子重建中验证 2 至 3 字符 Basic 倒排和四字符位置短语拆分方案
- [ ] 评估删除 `exact_file_names` 对精确文件名相关性排序的影响
- [ ] 评估大型种子文件采样数量和路径文本预算对搜索覆盖率与索引体积的影响
- [ ] 明确优化后的单文档平均占用重建峰值空间和预期最大可容纳种子数量
@@ -46,7 +44,7 @@
- [ ] 设计可在查询时计算热度的索引字段避免权重和等级调整触发再次重建
- [ ] 为完全同分的搜索结果增加稳定的最终排序键
- [ ] 将热度字段稳定排序键和索引空间优化合并为一次 Tantivy Schema 更新
- [ ] 优先复用现有字段实现动态热度和稳定排序 若确需新增字段则合并为一次 Tantivy Schema 更新
- [ ] 统计按需验证的 Peer 发现率握手成功率和平均验证耗时
- [ ] 根据真实验证数据校准热度权重等级边界和失败退避时间
@@ -98,8 +96,8 @@
## 当前下一步
先根据真实字段占用使用同一数据集比较文件名 N-Gram 候选方案并确定精简 Schema
部署紧凑文件名 Schema 并观察远端影子索引的重建进度峰值磁盘占用最终体积和常用查询延迟
同时继续观察六小时动态状态分桶 使用诊断中的安排刷新抑制刷新实际写入和跳过写入数量确认效果
Schema 调整时同时加入动态热度所需字段稳定排序键 最终只执行一次影子索引重建
本次 Schema 更新已经删除停用字段和重复代表标题 后续动态热度字段稳定排序键需要评估是否能够避免再次改变 Schema