ai-saas / saas-search

11 Apr, 2026

1 commit

a3275468 已把本仓库里的 `/indexer/enrich-content` 本地实现清理掉了，并把 indexer 主链路里对这套实现的隐式依赖一起摘掉。 ... Browse File »

这次代码侧的核心变化是：
- 删除了 `indexer/product_enrich.py`、`indexer/product_enrich_prompts.py` 及相关单测。
- 在 [api/routes/indexer.py](/data/saas-search/api/routes/indexer.py:55) 移除了 `/indexer/enrich-content` 路由；现在这个路径在本仓库 indexer 服务里会是 `404`，对应契约测试也已改成校验移除状态：[tests/ci/test_service_api_contracts.py](/data/saas-search/tests/ci/test_service_api_contracts.py:345)。
- 在 [api/routes/indexer.py](/data/saas-search/api/routes/indexer.py:183)、[indexer/document_transformer.py](/data/saas-search/indexer/document_transformer.py:109)、[indexer/incremental_service.py](/data/saas-search/indexer/incremental_service.py:587)、[indexer/spu_transformer.py](/data/saas-search/indexer/spu_transformer.py:223) 去掉了构建 doc 时自动补 `qanchors` / `enriched_*` 的本地 LLM 富化逻辑。现在 `build-docs` / `reindex` / `index` 只负责基础文档构建。
- 在 [config/schema.py](/data/saas-search/config/schema.py:316)、[config/loader.py](/data/saas-search/config/loader.py:824)、[config/env_config.py](/data/saas-search/config/env_config.py:37)、[config/config.yaml](/data/saas-search/config/config.yaml:32) 清掉了旧实现专用的 `product_enrich` 和 anchor cache 配置面。

重要文档也一起同步了，重点是把“能力已迁出、本仓库不再内置生成”写明确：
- [README.md](/data/saas-search/README.md:113)
- [docs/搜索API对接指南-00-总览与快速开始.md](</data/saas-search/docs/搜索API对接指南-00-总览与快速开始.md:108>)
- [docs/搜索API对接指南-05-索引接口（Indexer）.md](</data/saas-search/docs/搜索API对接指南-05-索引接口（Indexer）.md:647>)
- [docs/搜索API对接指南-07-微服务接口（Embedding-Reranker-Translation）.md](</data/saas-search/docs/搜索API对接指南-07-微服务接口（Embedding-Reranker-Translation）.md:441>)
- [docs/工作总结-微服务性能优化与架构.md](</data/saas-search/docs/工作总结-微服务性能优化与架构.md:96>)
- [docs/缓存与Redis使用说明.md](</data/saas-search/docs/缓存与Redis使用说明.md:186>)
- [indexer/README.md](/data/saas-search/indexer/README.md:508)
- [indexer/ANCHORS_AND_SEMANTIC_ATTRIBUTES.md](/data/saas-search/indexer/ANCHORS_AND_SEMANTIC_ATTRIBUTES.md:1)

验证做了两步：
- `python3 -m compileall ...` 通过
- `source activate.sh && python -m pytest tests/ci/test_service_api_contracts.py -q` 通过，`31 passed`

剩下我认为仍有“旧信息”但暂时没动的，主要是历史记录类文档，不算当前对接口径：
- [docs/issues/issue.md](/data/saas-search/docs/issues/issue.md:295)
- [docs/issues/issue.txt](/data/saas-search/docs/issues/issue.txt:468)
- [docs/issues/issue-2026-03-29-索引修改-done-0330.md](</data/saas-search/docs/issues/issue-2026-03-29-索引修改-done-0330.md:23>)
- [docs/issues/issue-2026-04-04-增加多模态标注-TODO.md](</data/saas-search/docs/issues/issue-2026-04-04-增加多模态标注-TODO.md:1>)

另外，工作区里原本就有 `.env` 修改和未跟踪的 `AGENTS.md`，我没有动它们。

2026-04-11 22:03:00 +0800

01 Apr, 2026

2 commits

9df421ed 基于eval框架开始调参 Browse File »

tangwang
2026-04-01 20:05:22 +0800
331861d5 eval框架配置化 Browse File »

tangwang
2026-04-01 15:29:36 +0800

30 Mar, 2026

1 commit

de98daa3 多模态召回优化 Browse File »

tangwang
2026-03-30 20:59:37 +0800

27 Mar, 2026

4 commits

daa2690b 漏斗参数调优&呈现优化 Browse File »

tangwang
2026-03-27 23:00:16 +0800

8c8b9d84 ES 拉取 coarse_rank.input_window 条 -> 粗排按 text/knn 融合裁到 ... Browse File »

coarse_rank.output_window -> 再做 SKU 选择和 title suffix ->
精排调用轻量 reranker 裁到 fine_rank.output_window -> 最终重排调用现有
reranker，并在最终融合里加入 fine_score。同时把 reranker client/provider
改成了按 service_profile 选不同 service_url，这样 fine/final
可以共用同一套服务代码，只起不同实例。

2026-03-27 17:56:04 +0800

ed13851c 图片文本两个knn召回相关参数配置 Browse File »

tangwang
2026-03-27 11:58:00 +0800

24edc208 修改_extract_combined_knn_score相关的代码以及配置， ... Browse File »

重排融合：之前有knn的配置bias和exponential。现在，文本和图片的embedding相似需要融合，融合方式是dis_max，因此需要配置：
1）各自的权重和tie_breaker
2）整个向量方面的权重（bias和exponential）

2026-03-27 08:33:16 +0800

25 Mar, 2026

2 commits

87cacb1b 融合公式优化。加入意图匹配因子 Browse File »

tangwang
2026-03-25 10:58:56 +0800

b712a831 意图识别策略和性能优化 ... Browse File »

@config/dictionaries/style_intent_color.csv
@config/dictionaries/style_intent_size.csv @query/style_intent.py
@search/sku_intent_selector.py
1. 两个csv词典，分为三列，
- 英文关键词
- 中文关键词
- 标准属性名称词
三列都可以允许逗号分割。补充的第三列使用在商品属性中，使用的是标准的英文名称
2.
判断意图的时候，中文词用中文翻译名去匹配，如果不存在中文翻译名，则用原始
query，英文词同理
3. SKU 选择的时候，用每一个 SKU 的属性名去匹配。
匹配规则要大幅度简化，并做性能优化：
1）文本匹配规则只需要看规范化后的属性值是否包含了词典配置的第三列"标准属性名称词"，如果包含了，则认为匹配成功。
找到第一个匹配成功的即可。如果都没有成功，后面也不再需要用向量匹配。
暂时废弃向量匹配、双向匹配等复杂逻辑。

2026-03-25 09:33:16 +0800

24 Mar, 2026

2 commits

74fdf9bd 1. ... Browse File »

加了一个过滤/降权词典，query中有独立分词匹配到指定的触发词，将过滤带某些分词的商品（比如fitted/修身，过滤宽松、loose、relaxed、baggy,slouchy等商品）
2. reranker的query使用翻译后的

2026-03-24 22:54:38 +0800

814e352b 乘法公式配置化 Browse File »

tangwang
2026-03-24 12:44:11 +0800

23 Mar, 2026

3 commits

cda1cd62 意图分析&应用 baseline Browse File »

tangwang
2026-03-23 22:35:20 +0800
445496cd fix last up: 每个翻译结果的检索表达式，单个multimatch -> ... Browse File »
```
combined_fields+best_field+phrase_boost
```
tangwang
2026-03-23 15:20:29 +0800

e756b18e 重构了文本召回构建器，现在每个 base_query / base_query_trans_* ... Browse File »

子句都变成了一个带有以下结构的命名布尔查询：

must：combined_fields

should：加权后的 best_fields 和 phrase 子句

主要改动位于
search/es_query_builder.py，但此次调整沿用了现有语言路由设计，并未引入一次性分支。额外的
should 子句权重现在通过
config/schema.py、config/loader.py、search/searcher.py 以及
config/config.yaml 进行配置驱动，从而保持结构的集中管理。

2026-03-23 14:45:06 +0800

22 Mar, 2026

2 commits

86d0e83d query翻译，根据源语言是否在索引语言中区分配置 Browse File »

tangwang
2026-03-22 18:53:53 +0800
0536222c query parser优化 Browse File »

tangwang
2026-03-22 18:30:05 +0800

20 Mar, 2026

3 commits

272aeabe 调参 Browse File »

tangwang
2026-03-20 17:37:04 +0800
1556989b query翻译等待超时逻辑 Browse File »

tangwang
2026-03-20 14:29:57 +0800
fe80e80e fix host config Browse File »

tangwang
2026-03-20 12:30:23 +0800

19 Mar, 2026

2 commits

41f0b2e9 product_enrich支持并发 Browse File »

tangwang
2026-03-19 23:32:53 +0800
86d8358b config optimize Browse File »

tangwang
2026-03-19 23:04:11 +0800