ai-saas / saas-search

09 Apr, 2026

3 commits

5aaf0c7d feat(indexer): 完善 enriched_taxonomy_attributes 接口输出及缓存设计 ... Browse Dir »

- `/indexer/enrich-content` 路由`enriched_taxonomy_attributes` 与
  `enriched_attributes` 一并返回
- 新增请求参数 `analysis_kinds`（可选，默认 `["content",
  "taxonomy"]`），允许调用方按需选择内容分析类型，为后续扩展和成本控制预留空间
- 重构缓存策略：将 `content` 与 `taxonomy` 两类分析的缓存完全隔离，缓存
  key 包含 prompt 模板、表头、输出字段定义（即 schema
指纹），确保提示词或解析规则变更时自动失效
- 缓存 key 仅依赖真正参与 LLM
  输入的字段（`title`、`brief`、`description`），`image_url`、`tenant_id`、`spu_id`
不再污染缓存键，提高缓存命中率
- 更新 API
  文档（`docs/搜索API对接指南-05-索引接口（Indexer）.md`），说明新增参数与返回字段

技术细节：
- 路由层调整：在 `api/routes/indexer.py` 的 enrich-content 端点中，将
  `product_enrich.enrich_products_batch` 返回的
`enriched_taxonomy_attributes` 字段显式加入 HTTP 响应体
- `analysis_kinds` 参数透传至底层
  `enrich_products_batch`，支持按需跳过某一类分析（如仅需 taxonomy
时减少 LLM 调用）
- 缓存指纹计算位于 `product_enrich.py` 的 `_get_cache_key` 函数，对每种
  `AnalysisSchema` 独立生成；版本号通过 `schema.version` 或 prompt
内容哈希隐式包含
- 测试覆盖：新增 `analysis_kinds` 组合场景及缓存隔离测试

2026-04-09 13:09:14 +0800

36516857 feat(product_enrich): 为产品富化模块增加 enriched_taxonomy_attributes ... Browse Dir »

字段生成

- 新增分类法属性富化能力，遵循 enriched_attributes
  相同的字段结构和处理逻辑，仅提示词和解析维度不同
- 引入 AnalysisSchema
  抽象类，使内容富化（content）与分类法富化（taxonomy）共享批处理、缓存、提示词构建、Markdown
解析及归一化流程
- 重构 product_enrich.py 中原有的富化管道，将通用逻辑抽取至
  _process_batch_for_schema、_parse_markdown_to_attributes
等函数，消除代码重复
- 在 product_enrich_prompts.py
  中添加分类法提示词模板（TAXONOMY_ANALYSIS_PROMPT）及 Markdown
表头定义（TAXONOMY_HEADERS）
- 修复 Markdown
  解析器在空单元格时的行为：原实现会跳过空单元格导致列错位，现改为保留空值，确保稀疏的分类法属性列正确对齐
- 更新 document_transformer.py 中 build_index_content_fields 函数，将
  enriched_taxonomy_attributes（中/英）写入最终索引文档
- 调整相关单元测试（test_product_enrich_partial_mode.py
  等）以覆盖新字段路径，测试通过（14 passed）

技术细节：
- AnalysisSchema 包含
  schema_name、prompt_template、headers、field_name_prefix 等元数据
-
缓存键区分内容/分类法：`enrich:{schema_name}:{product_id}`，避免缓存污染
- 分类法解析使用与 enriched_attributes
  相同的嵌套结构：`{"attribute_key": "value"}`，支持多行表格
- 批处理大小与重试逻辑保持与原有内容富化一致

2026-04-09 12:35:13 +0800

78cdef1c 添加字段enriched_taxonomy_attributes Browse Dir »

tangwang
2026-04-09 11:56:59 +0800

07 Apr, 2026

1 commit

e50924ed 1. tags -> enriched_tags ... Browse Dir »
```
2. issues文档
```
tangwang
2026-04-07 11:45:15 +0800

02 Apr, 2026

1 commit

41345271 文档更新 Browse Dir »

tangwang
2026-04-02 19:46:27 +0800

01 Apr, 2026

2 commits

80f1e036 enriched_attributes 现在会按 name 聚合，同名项下的 value.zh / value.en ... Browse Dir »

都会合并成数组，和 qanchors / enriched_tags
的处理方式保持一致，更符合你现在这套 ES mapping 的灌入方式。ES 的 text
字段本身支持数组，所以像 value.zh: ["舒适", "无鞋带设计"]
这种写法是可以正常入库的；nested
只是外层对象数组，不影响内部语言字段存数组。

2026-04-01 17:27:51 +0800

90de78aa enrich接口因为接口迭代、跟缓存不兼容，bug修复 ... Browse Dir »

`indexer/product_enrich.py`，不是再补一层判断。

根因有两个：缓存 key 按内容复用，但缓存值里还带着旧商品的
`id/title_input`；同时内部分析结果在历史上混用了 `tags` 和
`enriched_tags`。这样一旦命中旧缓存，`build_index_content_fields()`
会因为 `id` 对不上把结果丢掉，最后对外就变成全空。

现在的处理是：
- 内部分析结果统一用 `tags` 作为 LLM/缓存层字段。
- 对外只在 `build_index_content_fields()` 封装时映射成
  `enriched_tags`，`enriched_attributes` 里也统一产出
`name="enriched_tags"`。
- 读取缓存时会先做归一化：把旧缓存里的 `enriched_tags` 兼容成内部
  `tags`，并把命中的缓存结果重绑到当前请求商品的 `id/title_input`。
- 写缓存时也统一写成归一化后的内部结构，并且空内容不再写入缓存。

2026-04-01 11:06:23 +0800

30 Mar, 2026

2 commits

d350861f 索引结构修改 Browse Dir »

tangwang
2026-03-30 18:59:50 +0800
36cf0ef9 es索引结果修改 Browse Dir »

tangwang
2026-03-30 16:20:24 +0800

23 Mar, 2026

1 commit

69881ecb 相关性调参、enrich内容解析优化 Browse Dir »

tangwang
2026-03-23 09:02:19 +0800

19 Mar, 2026

2 commits

41f0b2e9 product_enrich支持并发 Browse Dir »

tangwang
2026-03-19 23:32:53 +0800
86d8358b config optimize Browse Dir »

tangwang
2026-03-19 23:04:11 +0800

18 Mar, 2026

3 commits

a47416ec 把融合逻辑改成乘法公式，并把 ES 命名子句分数回传链路补上了。 ... Browse Dir »

核心改动在 rerank_client.py (line 99)：fuse_scores_and_resort 现在按
rerank * knn * text 的平滑乘法公式计算，优先从 hit["matched_queries"]
里取 base_query 和 knn_query，并把 _text_score / _knn_score
一并写回调试字段。为了让 KNN 也有名字，我给 top-level knn 加了 name:
"knn_query"，见 es_query_builder.py (line 273)。搜索执行时会在 rerank
窗口内打开 include_named_queries_score，并在显式排序时加上
track_scores，见 searcher.py (line 400) 和 es_client.py (line 224)。

2026-03-18 10:24:05 +0800

76e1f088 1. 减少一列sell points。有时候大模型输出会将这最后两列混淆，因此干脆去掉一个 ... Browse Dir »
```
2. 优化缓存，缓存粒度为商品级，每次只对batch中未cache的重新计算；key使用每个商品输入的hash
```
tangwang
2026-03-18 10:15:41 +0800
a73a751f enrich Browse Dir »

tangwang
2026-03-18 09:10:53 +0800

17 Mar, 2026

4 commits

0fd2f875 translate Browse Dir »

tangwang
2026-03-17 19:21:34 +0800
77516841 tidy embeddings Browse Dir »

tangwang
2026-03-17 14:25:40 +0800
3d588bef embeddings Browse Dir »

tangwang
2026-03-17 13:53:50 +0800

6f7840cf refactor: rename product annotator to enrich and expand multilingual prompts ... Browse Dir »

- Rename indexer/product_annotator.py to indexer/product_enrich.py and remove CSV-based CLI entrypoint, keeping only in-memory analyze_products API
- Introduce dedicated product_enrich logging with separate verbose log file for full LLM requests/responses
- Change indexer and /indexer/enrich-content API wiring to use indexer.product_enrich instead of indexer.product_annotator, updating tests and docs accordingly
- Switch translate_prompts to share SUPPORTED_INDEX_LANGUAGES from tenant_config_loader and reuse that mapping for language code → display name
- Remove hard SUPPORTED_LANGS constraint from LLM content-enrichment flow, driving languages directly from tenant/indexer configuration
- Redesign LLM prompt generation to support multi-round, multi-language tables: first round in English, subsequent rounds translate the entire table (headers + cells) into target languages using English instructions

2026-03-17 11:26:03 +0800

16 Mar, 2026

1 commit

137455af doc Browse Dir »

tangwang
2026-03-16 22:47:34 +0800

13 Mar, 2026

4 commits

af827ce9 rerank Browse Dir »

tangwang
2026-03-13 23:21:51 +0800
d4cadc13 翻译重构 Browse Dir »

tangwang
2026-03-13 20:28:08 +0800
a0a173ae last Browse Dir »

tangwang
2026-03-13 16:56:44 +0800
22ae00c7 product_annotator Browse Dir »

tangwang
2026-03-13 13:48:23 +0800

11 Mar, 2026

1 commit

be3f0d46 /indexer/enrich-content Browse Dir »

tangwang
2026-03-11 14:36:33 +0800

10 Mar, 2026

1 commit

30f2a10b ansj -> ik Browse Dir »

tangwang
2026-03-10 21:24:41 +0800

09 Mar, 2026

5 commits

07cf5a93 START_EMBEDDING=1 START_TRANSLATOR=1 START_RERANKER=1 START_TEI=1 ... Browse Dir »
```
CNCLIP_DEVICE=cuda TEI_USE_GPU=1 ./scripts/service_ctl.sh start
搜索后端+indexer+测试前段+4个微服务 跑通
```
tangwang
2026-03-09 23:29:07 +0800
ed948666 tidy Browse Dir »

tangwang
2026-03-09 17:04:00 +0800
950a640e embeddings Browse Dir »

tangwang
2026-03-09 15:59:14 +0800
cc11ae04 cnclip Browse Dir »

tangwang
2026-03-09 13:26:40 +0800
e7a2c0b7 img encode Browse Dir »

tangwang
2026-03-09 10:25:44 +0800

07 Mar, 2026

1 commit

42e3aea6 tidy Browse Dir »

tangwang
2026-03-07 19:44:25 +0800

06 Mar, 2026

2 commits

484adbfe adapt ubuntu; conda -> venv Browse Dir »

tangwang
2026-03-06 18:50:20 +0800
a7920e17 项目名称和部署路径修改 Browse Dir »

tangwang
2026-03-06 17:32:37 +0800

05 Mar, 2026

1 commit

648cb4c2 ES docs Browse Dir »

tangwang
2026-03-05 23:12:27 +0800

03 Mar, 2026

2 commits

501066e1 redis 缓存 LLM结果 Browse Dir »

tangwang
2026-03-03 19:26:51 +0800
beef466f 商品索引的nchors 与语义属性 Browse Dir »

tangwang
2026-03-03 08:47:24 +0800

02 Mar, 2026

3 commits

d54b0467 feat: 为商品索引补充 qanchors 与语义属性 ... Browse Dir »

- 新增 indexer/process_products.analyze_products 接口，封装对 DashScope LLM 的调用逻辑，支持 zh/en/de/ru/fr 多语言输出，并结构化返回 anchor_text、tags、usage_scene、target_audience、season、key_attributes、material、features 等字段，既可脚本批处理也可在索引阶段按需调用。
- 在 SPUDocumentTransformer 中引入 _fill_llm_attributes，按租户 index_languages 与支持语言的交集，对每个 SPU/语言调用 analyze_products，默认开启 LLM 增强：成功时为 doc 填充 qanchors.{lang}（query 风格锚文本）以及 nested semantic_attributes(lang/name/value) 语义维度信息，失败时仅打 warn 日志并优雅降级，不影响主索引链路。
- 扩展 search_products.json mapping，在商品文档上新增 nested 字段 semantic_attributes(lang/name/value)，以通用三元组形式承载 LLM 抽取的场景、人群、材质、风格等可变维度，为后续按语义维度做过滤和分面聚合提供统一的结构化载体。
- 编写 indexer/ANCHORS_AND_SEMANTIC_ATTRIBUTES.md 设计文档，系统梳理 qanchors 与 semantic_attributes 的字段含义、索引与多语言策略、与 suggestion 构建器的集成方式以及在搜索过滤/分面中的推荐用法，方便后续维护与功能扩展。

Made-with: Cursor

2026-03-02 23:24:41 +0800

89638140 重构 indexer 文档构建接口与测试示例 ... Browse Dir »

- 新增 /indexer/build-docs 与 /indexer/build-docs-from-db 接口：前者接收上游传入的 SPU/SKU/Option 原始行数据构建 ES doc（不写 ES），后者在测试场景下基于 tenant_id+spu_ids 内部查库并复用同一套文档构建逻辑
- 调整增量与全量索引 SQL 与聚合逻辑：移除 shoplazza_product_spu.compare_at_price 读取，统一从 SKU 表聚合最大 compare_at_price，修复 1054 列不存在错误，保证 ES 字段 compare_at_price 来源与索引字段说明v2 保持一致
- 更新 SPUDocumentTransformer：完善价格区间计算、compare_at_price 聚合以及多语言字段输出，确保输出结构与 mappings/search_products.json、Java 侧 ProductIndexDocument 完全对齐
- 为 indexer 模块补充 README 与 prompts：系统化说明 Java 调度 + Python 富化的职责划分、翻译缓存方案（Redis translation:{tenant_id}:{target_lang}:{md5(text)}）以及 HTTP 接口使用方式
- 更新顶层 README、搜索API对接指南与测试Pipeline说明：增加关于 indexer 专用服务（serve-indexer, 端口6004）、正式文档构建接口以及手动链路验证（MySQL → build-docs → ES 查询对比）的说明
- 清理并修正 ES 诊断脚本 docs/常用查询 - ES.md：统一改为 per-tenant 索引 search_products_tenant_{tenant_id}，修正过期字段名（keywords 等）和分面聚合字段（去掉 .keyword，使用当前 mapping 中的字段）

Made-with: Cursor

2026-03-02 19:00:34 +0800

2e48a32d doc Browse Dir »

tangwang
2026-03-02 12:33:39 +0800