ai-saas / saas-search

20 Mar, 2026

1 commit

b754fd41 图片向量化支持优先级参数 Browse Dir »

tangwang
2026-03-20 11:59:57 +0800

18 Mar, 2026

3 commits

c90f80ed 相关性优化 Browse Dir »

tangwang
2026-03-18 16:44:27 +0800
a8261ece 检索效果优化 Browse Dir »

tangwang
2026-03-18 10:55:57 +0800

a47416ec 把融合逻辑改成乘法公式，并把 ES 命名子句分数回传链路补上了。 ... Browse Dir »

核心改动在 rerank_client.py (line 99)：fuse_scores_and_resort 现在按
rerank * knn * text 的平滑乘法公式计算，优先从 hit["matched_queries"]
里取 base_query 和 knn_query，并把 _text_score / _knn_score
一并写回调试字段。为了让 KNN 也有名字，我给 top-level knn 加了 name:
"knn_query"，见 es_query_builder.py (line 273)。搜索执行时会在 rerank
窗口内打开 include_named_queries_score，并在显式排序时加上
track_scores，见 searcher.py (line 400) 和 es_client.py (line 224)。

2026-03-18 10:24:05 +0800

13 Mar, 2026

3 commits

af827ce9 rerank Browse Dir »

tangwang
2026-03-13 23:21:51 +0800
33f8f578 tidy Browse Dir »

tangwang
2026-03-13 22:59:54 +0800
985752f5 1. 前端调试功能 ... Browse Dir »
```
2. 翻译限速 对应处理（qwen-mt限速）
```
tangwang
2026-03-13 16:15:06 +0800

12 Mar, 2026

4 commits

d31c7f65 补充云服务reranker Browse Dir »

tangwang
2026-03-12 12:53:08 +0800
a99e62ba 记录各阶段耗时 Browse Dir »

tangwang
2026-03-12 11:42:49 +0800
c51d254f 性能测试 Browse Dir »

tangwang
2026-03-12 10:28:43 +0800
5f7d7f09 性能测试报告.md Browse Dir »

tangwang
2026-03-12 08:44:55 +0800

11 Mar, 2026

2 commits

28e57bb1 日志体系优化 Browse Dir »

tangwang
2026-03-11 23:04:17 +0800
7fbca0d7 启动脚本优化 Browse Dir »

tangwang
2026-03-11 19:23:57 +0800

10 Mar, 2026

4 commits

bcada818 last Browse Dir »

tangwang
2026-03-10 16:17:18 +0800

bd96cead 1. 动态多语言字段与统一策略配置 ... Browse Dir »

- 配置改为“字段基名 + 动态语言后缀”方案，已不再依赖旧 `indexes`。
[config.yaml](/data/saas-search/config/config.yaml#L17)
- `search_fields` / `text_query_strategy` 已进入强校验与解析流程。
[config_loader.py](/data/saas-search/config/config_loader.py#L254)

2. 查询语言计划与翻译等待策略
- `QueryParser` 现在产出
  `query_text_by_lang`、`search_langs`、`source_in_index_languages`。
[query_parser.py](/data/saas-search/query/query_parser.py#L41)
- 你要求的两种翻译路径都在：
  - 源语言不在店铺 `index_languages`：`translate_multi_async` + 等待
    future
  - 源语言在 `index_languages`：`translate_multi(...,
    async_mode=True)`，尽量走缓存
[query_parser.py](/data/saas-search/query/query_parser.py#L284)

3. ES 查询统一文本策略（无 AST 分支）
- 主召回按 `search_langs` 动态拼 `field.{lang}`，翻译语种做次权重
  `should`。
[es_query_builder.py](/data/saas-search/search/es_query_builder.py#L454)
- 布尔 AST 路径已删除，仅保留统一文本策略。
[es_query_builder.py](/data/saas-search/search/es_query_builder.py#L185)

4. LanguageDetector 优化
- 从“拉丁字母默认英文”升级为：脚本优先 +
  拉丁语系打分（词典/变音/后缀）。
[language_detector.py](/data/saas-search/query/language_detector.py#L68)

5. 布尔能力清理（补充）
- 已删除废弃模块：
[boolean_parser.py](/data/saas-search/search/boolean_parser.py)
- `search/__init__` 已无相关导出。
[search/__init__.py](/data/saas-search/search/__init__.py)

6. `indexes` 过时收口（补充）
- 兼容函数改为基于动态字段生成，不再依赖 `config.indexes`。
[utils.py](/data/saas-search/config/utils.py#L24)
- Admin 配置接口改为返回动态字段配置，不再暴露 `num_indexes`。
[admin.py](/data/saas-search/api/routes/admin.py#L52)

7. suggest

2026-03-10 16:06:31 +0800

24e92141 delete enable_multilang_search Browse Dir »

tangwang
2026-03-10 13:12:56 +0800
26b910bd refactor service init and tighten multi-tenant search contracts Browse Dir »

tangwang
2026-03-10 13:09:24 +0800

09 Mar, 2026

2 commits

07cf5a93 START_EMBEDDING=1 START_TRANSLATOR=1 START_RERANKER=1 START_TEI=1 ... Browse Dir »
```
CNCLIP_DEVICE=cuda TEI_USE_GPU=1 ./scripts/service_ctl.sh start
搜索后端+indexer+测试前段+4个微服务 跑通
```
tangwang
2026-03-09 23:29:07 +0800
ed948666 tidy Browse Dir »

tangwang
2026-03-09 17:04:00 +0800

07 Mar, 2026

2 commits

42e3aea6 tidy Browse Dir »

tangwang
2026-03-07 19:44:25 +0800
d1d356f8 脚本优化 Browse Dir »

tangwang
2026-03-07 11:48:59 +0800

11 Feb, 2026

1 commit

ea118f2b build_query：根据 query_tokens 调整 KNN 参数： ... Browse Dir »

短查询（token_count ≤ 2）：knn_k=30, num_candidates=100, boost=0.15（约原权重 0.6）
中等查询（3–4）：knn_k=50, num_candidates=200, boost=0.25（默认）
长查询（token_count ≥ 5）：knn_k=80, num_candidates=300, boost=0.35（约原权重 1.4）

2026-02-11 18:41:00 +0800

06 Feb, 2026

1 commit

985d7fe3 为 filters 中所有字段加上 `*_all` 语义 ... Browse Dir »

---

 1. `search/es_query_builder.py`：`_all` 分支

- **普通字段**（如 `tags_all`, `category1_name_all`）：
  - 键以 `_all` 结尾时，先去掉后缀得到 ES 字段名。
  - 若值为**数组**：生成 `bool.must`，内含多个 `term`，即多值 **AND**。
  - 若值为**单值**：生成一个 `term`。
- **specifications_all**：
  - 值为 `[{name, value}, ...]` 时，为每一项生成一个 nested 查询，全部放入同一个 `bool.must`，即列表内所有规格条件都要满足（AND）。

原有逻辑不变：不带 `_all` 的字段，数组仍为 OR（`terms`），单值仍为 `term`。

 2. `api/models.py`：filters 说明

- 在 `filters` 的 `description` 中补充：
  - 字段名加 `_all` 表示 AND（如 `tags_all: ['A','B']` 表示同时包含 A 和 B）。
  - `specifications_all` 表示列表内所有规格条件都要满足。

 3. `docs/搜索API对接指南.md`：文档

- 在 3.3.1 开头说明：任意字段名可加 `_all` 后缀表示多值 AND。
- 在格式示例中增加 `tags_all`、`category1_name_all` 示例。
- 在「支持的值类型」中说明：数组在带 `_all` 时为 AND。
- 新增小节「`*_all` 语义（多值 AND）」：说明用法及 `specifications_all` 行为。
- 在「常用过滤字段」中补充：以上字段均可加 `_all` 后缀。

---

**使用示例**

```json
{
  "filters": {
    "tags": ["手机", "促销"],
    "tags_all": ["手机", "促销", "新品"]
  }
}
```

- `tags`：命中「手机」或「促销」或两者都有（OR）。
- `tags_all`：必须同时包含「手机」「促销」「新品」三个标签（AND）。

2026-02-06 11:23:06 +0800

05 Feb, 2026

2 commits

ff32d894 rerank Browse Dir »

tangwang
2026-02-05 16:13:46 +0800

506c39b7 feat(search): 统一重排逻辑，仅由 ai_search 控制并调用外部 BGE 重排服务 ... Browse Dir »

- API：新增请求参数 ai_search，开启时在窗口内走重排流程
- 配置：RerankConfig 移除 enabled/expression/description，仅保留 rerank_window 及
  service_url/timeout_sec/weight_es/weight_ai；默认超时 15s
- 重排流程：ai_search 且 from+size<=rerank_window 时，ES 取前 rerank_window 条，
  调用外部 /rerank 服务，融合 ES 与重排分数后按 from/size 分页；否则不重排
- search/rerank_client：新增模块，封装 build_docs、call_rerank_service、
  fuse_scores_and_resort、run_rerank；超时单独捕获并简短日志
- search/searcher：移除 RerankEngine，enable_rerank=ai_search，使用 config.rerank 参数
- 删除 search/rerank_engine.py（本地表达式重排），统一为外部服务一种实现
- 文档：搜索 API 对接指南补充 ai_search 与 relevance_score 说明
- 测试：conftest 中 rerank 配置改为新结构

Co-authored-by: Cursor <cursoragent@cursor.com>

2026-02-05 14:13:41 +0800

27 Jan, 2026

2 commits

038e4e2f refactor(i18n): translate_to_en/zh 改为可配置 index_languages，默认 [en,zh] ... Browse Dir »

- config: 新增 SUPPORTED_INDEX_LANGUAGES（38 种语言）、DEFAULT_INDEX_LANGUAGES、
  normalize_index_languages、resolve_index_languages；get_tenant_config 统一注入 index_languages
- config.yaml: 租户配置改用 index_languages，默认 [en,zh]，保留 translate_to_* 兼容解析
- query/translator: translate_for_indexing 改为接收 index_languages，返回多语言 Dict
- query/query_parser: 翻译目标从 index_languages 解析，need_wait_translation 按 index_langs 判断
- search/searcher: enable_translation 改为基于 index_languages 是否非空
- indexer: document_transformer 按 index_languages 填多语言字段；indexing_utils 仅多语言时初始化翻译器
- tests: 租户配置与索引测试改为断言 index_languages
- README: 更新 TODO 说明已支持 index_languages

2026-01-27 16:51:35 +0800

3a5fda00 1. ES字段 skus的 image_src 字段读取兼容 imageSrc （ES 本应该写入image_src，但是写入了imageSrc，暂时不做全量了，这里兼容下） ... Browse Dir »
```
2. 返回query_normlized
```
tangwang
2026-01-27 10:24:14 +0800

06 Jan, 2026

2 commits

2739b281 多语言索引调整 Browse Dir »

tangwang
2026-01-06 19:59:36 +0800

d7d48f52 改动（mapping + 灌入结构） ... Browse Dir »

mappings/search_products.json：把原来的 title_zh/title_en/brief_zh/... 改成 按语言 key 的对象结构（ /products/_doc/1 { "title": {"en":...} } ）
同时在这些字段下 预置了全部 analyzer 语言:
arabic, armenian, basque, brazilian, bulgarian, catalan, chinese, cjk, czech, danish, dutch, english, finnish, french, galician, german, greek, hindi, hungarian, indonesian, italian, norwegian, persian, portuguese, romanian, russian, spanish, swedish, turkish, thai

实现为 type: object + properties，同时满足“按语言灌入”和“按语言 analyzer”。
索引灌入（全量/增量/transformer）已同步改完
indexer/document_transformer.py：输出从 title_zh/title_en/... 改为：
title: {<primary_lang>: 原文, en?: 翻译, zh?: 翻译}
brief/description/vendor 同理
category_path/category_name_text 也改为语言对象（避免查询侧继续依赖旧字段）
indexer/incremental_service.py：embedding 取值从 title_en/title_zh 改为从 title 对象里优先取 en，否则取 zh，否则取任一可用语言。
查询侧与配置、API/文档已同步
search/es_query_builder.py：查询字段统一改成点路径：title.zh / title.en / vendor.zh / vendor.zh.keyword / category_name_text.zh 等。
config/config.yaml：field boosts / indexes 里的字段名同步为新点路径。
API & formatter：
api/result_formatter.py 已支持新结构（并保留对旧 *_zh/_en 的兼容兜底）。
api/models.py、相关 docs/examples 里的 vendor_zh.keyword 等已更新为 vendor.zh.keyword。
文档/脚本：docs/、README.md、scripts/ 里所有旧字段名引用已批量替换为新结构。

2026-01-06 19:42:20 +0800

31 Dec, 2025

1 commit

768ad710 MySQL到ES字段映射说明-业务版.md Browse Dir »

tangwang
2025-12-31 16:58:16 +0800

27 Dec, 2025

1 commit

e4a39cc8 索引隔离。不同的tenant_id用不同的索引 Browse Dir »

tangwang
2025-12-27 15:02:31 +0800

25 Dec, 2025

1 commit

d8ca3b13 修复分面结果各个选项结果数和实际不一致的问题（因为统计的是子文档个数） ... Browse Dir »

问题：nested 聚合统计的是嵌套文档（specifications 条目）数量，而不是产品（父文档）数量。
修复内容：
在 es_query_builder.py 中：为 specifications 分面的聚合添加了 reverse_nested 子聚合，用于统计产品数量：
   "aggs": {       "product_count": {           "reverse_nested": {}       }   }
在 result_formatter.py 中：更新读取逻辑，从 product_count.doc_count 读取产品数量，而不是直接使用 doc_count。
修复效果：
之前：分面显示 62（统计了 62 个嵌套文档/规格条目）
现在：分面显示实际的产品数量（例如 2），与搜索结果数量一致

2025-12-25 13:12:34 +0800

20 Dec, 2025

1 commit

70dab99f add logs Browse Dir »

tangwang
2025-12-20 14:50:13 +0800

18 Dec, 2025

1 commit

345d960b 1. 删除全局 enable_translation 配置 ... Browse Dir »

config/config_loader.py: 从 QueryConfig 类中删除 enable_translation 字段
config/config.yaml: 删除 enable_translation: true 配置项
config/config_loader.py: 从 to_dict() 方法中删除相关输出
2. 索引阶段（离线）- 使用租户配置
indexer/indexing_utils.py:
根据 tenant_config.translate_to_en 和 translate_to_zh 决定是否初始化 translator
只有任一方向开启时才创建 translator
indexer/document_transformer.py:
_fill_text_fields 从 tenant_config 读取 translate_to_en 和 translate_to_zh
调用 translate_for_indexing 时传递这两个参数
更新了文档注释
3. 查询阶段（在线）- 使用租户配置
query/query_parser.py:
parse() 方法新增 tenant_id 参数
根据租户配置决定翻译目标语言（translate_to_zh / translate_to_en）
如果两个都是 false，跳过翻译阶段
translator 属性不再依赖 enable_translation，总是可以初始化
search/searcher.py:
search() 方法中根据租户配置计算 enable_translation（用于日志和 metadata）
调用 query_parser.parse() 时传递 tenant_id
4. 翻译器方法更新
query/translator.py:
translate_for_indexing() 新增 translate_to_en 和 translate_to_zh 参数（默认 True 保持向后兼容）
根据这两个参数决定翻译目标
更新了文档注释

2025-12-18 19:18:28 +0800

08 Dec, 2025

1 commit

a5a6bab8 多语言查询优化 Browse Dir »

tangwang
2025-12-08 11:47:58 +0800

05 Dec, 2025

2 commits

7bc756c5 优化 ES 查询构建 ... Browse Dir »

将 must 子句改为 should 子句的多查询策略
实现以下查询类型：
base_query：主查询，使用 AND 操作符和 75% minimum_should_match
翻译查询：跨语言查询，boost=0.4
短语查询：短查询的精确短语匹配
关键词查询：基于提取名词的查询，boost=0.1
添加 _get_match_fields() 方法，支持中英文字段动态映射
4. 关键改进点
minimum_should_match 从 67% 提升到 75%
添加 operator: "AND" 确保所有词都匹配
使用 should 子句实现多策略融合
支持短语查询和关键词查询的智能触发

2025-12-05 22:54:06 +0800

9a9b9ec5 1. facet disjunctive ... Browse Dir »
```
2. queries
```
tangwang
2025-12-05 19:39:47 +0800

04 Dec, 2025

1 commit

c581becd feat: 实现 Multi-Select Faceting 和 Selected 状态标记 ... Browse Dir »

核心功能：
- 添加 multi_select 字段到 FacetConfig（默认为 true）
- 实现 post_filter 支持 disjunctive faceting
- 后端自动标记 facet 值的 selected 状态
- 支持 specifications 和普通字段的 multi-select

技术改进：
- ESQueryBuilder: 分离 conjunctive/disjunctive filters
- ResultFormatter: 根据 current_filters 标记 selected
- Searcher: 传递 facet_configs 给 query builder

文档更新：
- 添加 multi_select_faceting.md 详细文档
- 更新 API 对接指南，说明新功能
- 添加测试脚本 test_multi_select_facet.py

业界标准：
- 遵循 Elasticsearch/Algolia/Amazon 的最佳实践
- 提供探索式搜索体验
- 前后端职责清晰分离

2025-12-04 15:29:52 +0800

03 Dec, 2025

2 commits

13320ac6 分面接口修改： ... Browse Dir »

{
  "facets": [
    {
      "field": "category1_name",
      "size": 15,
      "type": "terms"
    },
    "specifications.color",
    "specifications.size"
  ]
}

{
  "facets": [
    {"field": "category1_name", "size": 15, "type": "terms"},
    {"field": "specifications.color", "size": 10, "type": "terms"},
    {"field": "specifications.size", "size": 10, "type": "terms"}
  ]
}

之前是上面的接口形式，主要是考虑 属性的分面， 因为 款式都是有限的 不需要设定 "size": 10, "type": "terms" 这些参数。

但是从接口设计层面，最好按下面这样，这样的话 specifications.color 和 category1_name 的组装格式 完全一样。前端不需要感知 属性分面 和 类别等其他字段分面的差异。

2025-12-03 21:20:50 +0800

e7ad2b4a 测试页面分页配置 Browse Dir »

tangwang
2025-12-03 11:42:35 +0800