ai-saas / saas-search

09 Apr, 2026

2 commits

dabd52a5 feat(indexer): 支持多品类 taxonomy 动态适配与双语/en 输出控制 ... Browse File »

本次迭代对检索系统的内容复化模块进行了较大规模的重构，将原先硬编码的“仅服饰(apparel)”品类拓展至
taxonomy.md
中定义的所有品类，同时优化了代码结构，降低了扩展新品类的成本。核心设计采用注册表模式(profile
registry)，按品类 profile
分组进行批处理，并明确区分双语(zh+en)与仅英文(en)输出策略。

【修改内容】

1. 品类支持范围扩展
   -
新增支持的品类：3c、bags、pet_supplies、electronics、outdoor、home_appliances、home_living、wigs、beauty、accessories、toys、shoes、sports、others
   - 所有新品类在 taxonomy 输出阶段仅返回 en 字段，避免多语言字段膨胀
   - 保留服饰(apparel)品类的双语输出(zh + en)，维持原有业务兼容性

2. 核心代码重构
   - `indexer/product_enrich.py`
     - 新增 `TAXONOMY_PROFILES`
       注册表，以数据驱动方式定义每个品类的输出语言、prompt
映射、taxonomy 字段集合
     - 重写 `_enrich_taxonomy_batch`：按 profile 分组批量调用
       LLM，避免为每个品类编写独立分支
     - 引入 `_infer_profile_from_category()` 函数，从 SPU 的 category
       字段自动推断所属 profile（用于内部索引路径，解决混合目录默认
fallback 到服饰的问题）
   - `indexer/product_enrich_prompts.py`
     - 将原有单一服饰 prompt 重构为 `PROMPT_TEMPLATES` 字典，按 profile
       存储不同提示词
     - 所有非服饰品类共享一套精简提示模板，仅要求输出 en 字段
   - `indexer/document_transformer.py`
     - 在构建 enrichment 请求时传递 category 信息，供下游按 profile 路由
     - 调整 `_build_enrich_batch` 逻辑，使批量请求支持混合品类并正确分组
   - `indexer/indexer.py`（API 层）
     - `/indexer/enrich-content` 接口的请求模型增加可选的
       `category_profile`
字段，允许调用方显式指定品类；未指定时由服务端自动推断
     - 更新参数校验与错误处理，新增对 `others` 等兜底品类的支持

3. 文档同步更新
   - `docs/搜索API对接指南-05-索引接口（Indexer）.md`：增加品类 profile
     参数说明，标注非服饰品类 taxonomy 仅返回 en 字段
   -
`docs/搜索API对接指南-07-微服务接口（Embedding-Reranker-Translation）.md`：更新
enrichment 微服务的调用示例，体现多品类分组批处理
   - `taxonomy.md`：补充各品类的字段清单，明确 en
     字段为所有非服饰品类的唯一输出

【技术细节】

- **注册表设计**：
  ```python
  TAXONOMY_PROFILES = {
      "apparel": {"lang": ["zh", "en"], "prompt_key": "apparel",
"fields": [...]},
      "3c": {"lang": ["en"], "prompt_key": "default", "fields": [...]},
      \# ...
  }
  ```
  新增品类只需在注册表中添加一项，并确保 `PROMPT_TEMPLATES` 中存在对应的
prompt_key，无需修改控制流逻辑。

- **按 profile 分组批处理**：
  - 原有实现：所有产品混在一起，使用同一套服饰
    prompt，导致非服饰产品被错误填充。
  - 重构后：`_enrich_taxonomy_batch` 先根据每个产品的 profile
    分组，每组独立构造 LLM
请求，响应结果再按原始顺序合并。分组粒度可配置，避免小分组带来的过多请求开销。

- **自动品类推断**：
  - 对于内部索引（非显式调用 enrichment 接口的场景），通过
    `_infer_profile_from_category` 解析 SPU 的 `category_l1/l2/l3`
字段，映射到最匹配的
profile。映射规则基于关键词匹配（如“手机”->“3c”，“狗粮”->“pet_supplies”），未匹配时
fallback 到 `apparel` 以保证系统平稳过渡。

- **输出字段裁剪**：
  - 由于 Elasticsearch mapping 中 `enriched_taxonomy_attributes.value`
    字段仅存储单个值（不分语言），非服饰品类的 LLM
输出直接写入该字段；服饰品类则使用动态模板 `value.zh` 和
`value.en`。代码中通过 `_apply_lang_output` 函数统一处理。

- **代码量与可维护性**：
  - 虽然因新增大量品类定义导致总行数略有增长（~+180
    行），但条件分支数量从 5 处减少到 1 处（仅 profile
查找）。新增品类的平均成本仅为注册表 3 行 + prompt 模板 10
行，无需改动核心 enrichment 循环。

【影响文件】
- `indexer/product_enrich.py`
- `indexer/product_enrich_prompts.py`
- `indexer/document_transformer.py`
- `indexer/indexer.py`
- `docs/搜索API对接指南-05-索引接口（Indexer）.md`
-
`docs/搜索API对接指南-07-微服务接口（Embedding-Reranker-Translation）.md`
- `taxonomy.md`
- `tests/test_product_enrich_partial_mode.py`（适配多 profile 测试用例）
- `tests/test_llm_enrichment_batch_fill.py`
- `tests/test_process_products_batching.py`

【测试验证】
- 执行单元测试与集成测试：`pytest
  tests/test_product_enrich_partial_mode.py
tests/test_llm_enrichment_batch_fill.py
tests/test_process_products_batching.py
tests/ci/test_service_api_contracts.py`，全部通过（52 passed）
- 手动验证混合目录场景：同时提交服饰与 3c 产品，enrichment
  响应中服饰返回双语，3c 仅返回 en，且 taxonomy 字段正确填充。
- 编译检查：`py_compile` 所有修改模块无语法错误。

【注意事项】
- 本次重构未改变现有服饰品类的行为，API 向后兼容（未指定 profile
  时仍按服饰处理）。
- 若后续需为某品类增加双语支持，只需修改注册表中的 `lang` 列表并补充
  prompt 模板，无需改动其他逻辑。

2026-04-09 15:00:17 +0800

36516857 feat(product_enrich): 为产品富化模块增加 enriched_taxonomy_attributes ... Browse File »

字段生成

- 新增分类法属性富化能力，遵循 enriched_attributes
  相同的字段结构和处理逻辑，仅提示词和解析维度不同
- 引入 AnalysisSchema
  抽象类，使内容富化（content）与分类法富化（taxonomy）共享批处理、缓存、提示词构建、Markdown
解析及归一化流程
- 重构 product_enrich.py 中原有的富化管道，将通用逻辑抽取至
  _process_batch_for_schema、_parse_markdown_to_attributes
等函数，消除代码重复
- 在 product_enrich_prompts.py
  中添加分类法提示词模板（TAXONOMY_ANALYSIS_PROMPT）及 Markdown
表头定义（TAXONOMY_HEADERS）
- 修复 Markdown
  解析器在空单元格时的行为：原实现会跳过空单元格导致列错位，现改为保留空值，确保稀疏的分类法属性列正确对齐
- 更新 document_transformer.py 中 build_index_content_fields 函数，将
  enriched_taxonomy_attributes（中/英）写入最终索引文档
- 调整相关单元测试（test_product_enrich_partial_mode.py
  等）以覆盖新字段路径，测试通过（14 passed）

技术细节：
- AnalysisSchema 包含
  schema_name、prompt_template、headers、field_name_prefix 等元数据
-
缓存键区分内容/分类法：`enrich:{schema_name}:{product_id}`，避免缓存污染
- 分类法解析使用与 enriched_attributes
  相同的嵌套结构：`{"attribute_key": "value"}`，支持多行表格
- 批处理大小与重试逻辑保持与原有内容富化一致

2026-04-09 12:35:13 +0800

07 Apr, 2026

1 commit

e50924ed 1. tags -> enriched_tags ... Browse File »
```
2. issues文档
```
tangwang
2026-04-07 11:45:15 +0800

18 Mar, 2026

3 commits

a47416ec 把融合逻辑改成乘法公式，并把 ES 命名子句分数回传链路补上了。 ... Browse File »

核心改动在 rerank_client.py (line 99)：fuse_scores_and_resort 现在按
rerank * knn * text 的平滑乘法公式计算，优先从 hit["matched_queries"]
里取 base_query 和 knn_query，并把 _text_score / _knn_score
一并写回调试字段。为了让 KNN 也有名字，我给 top-level knn 加了 name:
"knn_query"，见 es_query_builder.py (line 273)。搜索执行时会在 rerank
窗口内打开 include_named_queries_score，并在显式排序时加上
track_scores，见 searcher.py (line 400) 和 es_client.py (line 224)。

2026-03-18 10:24:05 +0800

76e1f088 1. 减少一列sell points。有时候大模型输出会将这最后两列混淆，因此干脆去掉一个 ... Browse File »
```
2. 优化缓存，缓存粒度为商品级，每次只对batch中未cache的重新计算；key使用每个商品输入的hash
```
tangwang
2026-03-18 10:15:41 +0800
a73a751f enrich Browse File »

tangwang
2026-03-18 09:10:53 +0800