ai-saas / saas-search

09 Apr, 2026

2 commits

048631be 1. 新增说明文档《product_enrich模块说明.md》 ... Browse File »

2. 删掉自动推断 taxonomy profile的逻辑，build_index_content_fields()
3. 所有 taxonomy profile 都输出 zh/en”，并把按行业切语言的逻辑去掉
   只接受显式传入的 category_taxonomy_profile

2026-04-09 18:25:43 +0800

36516857 feat(product_enrich): 为产品富化模块增加 enriched_taxonomy_attributes ... Browse File »

字段生成

- 新增分类法属性富化能力，遵循 enriched_attributes
  相同的字段结构和处理逻辑，仅提示词和解析维度不同
- 引入 AnalysisSchema
  抽象类，使内容富化（content）与分类法富化（taxonomy）共享批处理、缓存、提示词构建、Markdown
解析及归一化流程
- 重构 product_enrich.py 中原有的富化管道，将通用逻辑抽取至
  _process_batch_for_schema、_parse_markdown_to_attributes
等函数，消除代码重复
- 在 product_enrich_prompts.py
  中添加分类法提示词模板（TAXONOMY_ANALYSIS_PROMPT）及 Markdown
表头定义（TAXONOMY_HEADERS）
- 修复 Markdown
  解析器在空单元格时的行为：原实现会跳过空单元格导致列错位，现改为保留空值，确保稀疏的分类法属性列正确对齐
- 更新 document_transformer.py 中 build_index_content_fields 函数，将
  enriched_taxonomy_attributes（中/英）写入最终索引文档
- 调整相关单元测试（test_product_enrich_partial_mode.py
  等）以覆盖新字段路径，测试通过（14 passed）

技术细节：
- AnalysisSchema 包含
  schema_name、prompt_template、headers、field_name_prefix 等元数据
-
缓存键区分内容/分类法：`enrich:{schema_name}:{product_id}`，避免缓存污染
- 分类法解析使用与 enriched_attributes
  相同的嵌套结构：`{"attribute_key": "value"}`，支持多行表格
- 批处理大小与重试逻辑保持与原有内容富化一致

2026-04-09 12:35:13 +0800

01 Apr, 2026

1 commit

80f1e036 enriched_attributes 现在会按 name 聚合，同名项下的 value.zh / value.en ... Browse File »

都会合并成数组，和 qanchors / enriched_tags
的处理方式保持一致，更符合你现在这套 ES mapping 的灌入方式。ES 的 text
字段本身支持数组，所以像 value.zh: ["舒适", "无鞋带设计"]
这种写法是可以正常入库的；nested
只是外层对象数组，不影响内部语言字段存数组。

2026-04-01 17:27:51 +0800

30 Mar, 2026

1 commit

d350861f 索引结构修改 Browse File »

tangwang
2026-03-30 18:59:50 +0800

11 Mar, 2026

1 commit

be3f0d46 /indexer/enrich-content Browse File »

tangwang
2026-03-11 14:36:33 +0800