ai-saas / saas-search

23 Mar, 2026

3 commits

4650fcec 日志优化、日志串联（uid rqid） Browse File »

tangwang
2026-03-23 23:45:04 +0800
cda1cd62 意图分析&应用 baseline Browse File »

tangwang
2026-03-23 22:35:20 +0800
35da3813 中英混写query的优化逻辑，不适合新的combined_fields+best_fields+phrase查询方式，带来的复杂度较多，清理该部分逻辑 Browse File »

tangwang
2026-03-23 17:12:01 +0800

22 Mar, 2026

2 commits

86d0e83d query翻译，根据源语言是否在索引语言中区分配置 Browse File »

tangwang
2026-03-22 18:53:53 +0800
ef5baa86 混杂语言处理 Browse File »

tangwang
2026-03-22 14:16:39 +0800

21 Mar, 2026

1 commit

00c8ddb9 suggest rank optimize Browse File »

tangwang
2026-03-21 19:41:23 +0800

20 Mar, 2026

3 commits

6823fe3e feat(search): 混合语种查询分析与跨语言字段召回 ... Browse File »

## 背景
多语言索引下，用户查询常中英混写；需在解析阶段显式标记脚本类型，并在 BM25 子句中同时覆盖对应语言字段。

## 方案

### 1. Query 分析（query_parser.ParsedQuery）
- 新增 `contains_chinese`：query 文本含 CJK（沿用 _contains_cjk）。
- 新增 `contains_english`：分词结果中存在「纯英文、len>=3」token（fullmatch 字母及可选连字符）。
- 写入 to_dict、请求 context 中间结果，便于调试与 API 透出。

### 2. ES 文本召回（es_query_builder._build_advanced_text_query）
- 对每个 search_lang 子句：若含英文且子句语言非 en（且租户 index_languages 含 en），合并 en 列字段；若含中文且子句语言非 zh（且含 zh），合并 zh 列字段。
- 合并进来的字段 boost 乘以 `mixed_script_merged_field_boost_scale`（默认 0.8，可在 ESQueryBuilder 构造参数调整）。
- fallback_original_query_* 分支同样应用上述逻辑。

### 3. 实现整理
- 引入 `MatchFieldSpec = (field_path, boost)`：`_build_match_field_specs` 为唯一权重来源；`_merge_supplemental_lang_field_specs` / `_expand_match_field_specs_for_mixed_script` 在 tuple 上合并与缩放；最后 `_format_match_field_specs` 再格式化为 ES `path^boost`，避免先拼字符串再解析。

## 测试
- tests/test_query_parser_mixed_language.py：脚本标记与 token 规则。
- tests/test_es_query_builder.py：合并字段、0.8 缩放、index_languages 限制。

Made-with: Cursor

2026-03-20 14:45:57 +0800

1556989b query翻译等待超时逻辑 Browse File »

tangwang
2026-03-20 14:29:57 +0800
b754fd41 图片向量化支持优先级参数 Browse File »

tangwang
2026-03-20 11:59:57 +0800

19 Mar, 2026

3 commits

41f0b2e9 product_enrich支持并发 Browse File »

tangwang
2026-03-19 23:32:53 +0800
86d8358b config optimize Browse File »

tangwang
2026-03-19 23:04:11 +0800
77bfa7e3 query translate Browse File »

tangwang
2026-03-19 17:22:14 +0800

18 Mar, 2026

1 commit

a8261ece 检索效果优化 Browse File »

tangwang
2026-03-18 10:55:57 +0800

17 Mar, 2026

3 commits

e56fbdc1 query trans Browse File »

tangwang
2026-03-17 22:47:14 +0800
0fd2f875 translate Browse File »

tangwang
2026-03-17 19:21:34 +0800

5e4dc8e4 翻译架构按“一个翻译服务 + ... Browse File »

多个独立翻译能力”重构。现在业务侧不再把翻译当 provider
选型，QueryParser 和 indexer 统一通过 6006 的 translator service client
调用；真正的能力选择、启用开关、model + scene 路由，都收口到服务端和新的
translation/ 目录里了。

这次的核心改动在
config/services_config.py、providers/translation.py、api/translator_app.py、config/config.yaml
和新的 translation/service.py。配置从旧的
services.translation.provider/providers 改成了 service_url +
default_model + default_scene + capabilities，每个能力可独立
enabled；服务端新增了统一的 backend 管理与懒加载，真实实现集中到
translation/backends/qwen_mt.py、translation/backends/llm.py、translation/backends/deepl.py，旧的
query/qwen_mt_translate.py、query/llm_translate.py、query/deepl_provider.py
只保留兼容导出。接口上，/translate 现在标准支持 scene，context
作为兼容别名继续可用，健康检查会返回默认模型、默认场景和已启用能力。

2026-03-17 15:50:53 +0800

13 Mar, 2026

1 commit

d4cadc13 翻译重构 Browse File »

tangwang
2026-03-13 20:28:08 +0800

10 Mar, 2026

2 commits

bd96cead 1. 动态多语言字段与统一策略配置 ... Browse File »

- 配置改为“字段基名 + 动态语言后缀”方案，已不再依赖旧 `indexes`。
[config.yaml](/data/saas-search/config/config.yaml#L17)
- `search_fields` / `text_query_strategy` 已进入强校验与解析流程。
[config_loader.py](/data/saas-search/config/config_loader.py#L254)

2. 查询语言计划与翻译等待策略
- `QueryParser` 现在产出
  `query_text_by_lang`、`search_langs`、`source_in_index_languages`。
[query_parser.py](/data/saas-search/query/query_parser.py#L41)
- 你要求的两种翻译路径都在：
  - 源语言不在店铺 `index_languages`：`translate_multi_async` + 等待
    future
  - 源语言在 `index_languages`：`translate_multi(...,
    async_mode=True)`，尽量走缓存
[query_parser.py](/data/saas-search/query/query_parser.py#L284)

3. ES 查询统一文本策略（无 AST 分支）
- 主召回按 `search_langs` 动态拼 `field.{lang}`，翻译语种做次权重
  `should`。
[es_query_builder.py](/data/saas-search/search/es_query_builder.py#L454)
- 布尔 AST 路径已删除，仅保留统一文本策略。
[es_query_builder.py](/data/saas-search/search/es_query_builder.py#L185)

4. LanguageDetector 优化
- 从“拉丁字母默认英文”升级为：脚本优先 +
  拉丁语系打分（词典/变音/后缀）。
[language_detector.py](/data/saas-search/query/language_detector.py#L68)

5. 布尔能力清理（补充）
- 已删除废弃模块：
[boolean_parser.py](/data/saas-search/search/boolean_parser.py)
- `search/__init__` 已无相关导出。
[search/__init__.py](/data/saas-search/search/__init__.py)

6. `indexes` 过时收口（补充）
- 兼容函数改为基于动态字段生成，不再依赖 `config.indexes`。
[utils.py](/data/saas-search/config/utils.py#L24)
- Admin 配置接口改为返回动态字段配置，不再暴露 `num_indexes`。
[admin.py](/data/saas-search/api/routes/admin.py#L52)

7. suggest

2026-03-10 16:06:31 +0800

26b910bd refactor service init and tighten multi-tenant search contracts Browse File »

tangwang
2026-03-10 13:09:24 +0800

09 Mar, 2026

2 commits

07cf5a93 START_EMBEDDING=1 START_TRANSLATOR=1 START_RERANKER=1 START_TEI=1 ... Browse File »
```
CNCLIP_DEVICE=cuda TEI_USE_GPU=1 ./scripts/service_ctl.sh start
搜索后端+indexer+测试前段+4个微服务 跑通
```
tangwang
2026-03-09 23:29:07 +0800
950a640e embeddings Browse File »

tangwang
2026-03-09 15:59:14 +0800

07 Mar, 2026

1 commit

42e3aea6 tidy Browse File »

tangwang
2026-03-07 19:44:25 +0800

06 Mar, 2026

1 commit

484adbfe adapt ubuntu; conda -> venv Browse File »

tangwang
2026-03-06 18:50:20 +0800

11 Feb, 2026

1 commit

ea118f2b build_query：根据 query_tokens 调整 KNN 参数： ... Browse File »

短查询（token_count ≤ 2）：knn_k=30, num_candidates=100, boost=0.15（约原权重 0.6）
中等查询（3–4）：knn_k=50, num_candidates=200, boost=0.25（默认）
长查询（token_count ≥ 5）：knn_k=80, num_candidates=300, boost=0.35（约原权重 1.4）

2026-02-11 18:41:00 +0800

04 Feb, 2026

1 commit

d90e7428 补充重排 Browse File »

tangwang
2026-02-04 19:48:05 +0800

27 Jan, 2026

2 commits

038e4e2f refactor(i18n): translate_to_en/zh 改为可配置 index_languages，默认 [en,zh] ... Browse File »

- config: 新增 SUPPORTED_INDEX_LANGUAGES（38 种语言）、DEFAULT_INDEX_LANGUAGES、
  normalize_index_languages、resolve_index_languages；get_tenant_config 统一注入 index_languages
- config.yaml: 租户配置改用 index_languages，默认 [en,zh]，保留 translate_to_* 兼容解析
- query/translator: translate_for_indexing 改为接收 index_languages，返回多语言 Dict
- query/query_parser: 翻译目标从 index_languages 解析，need_wait_translation 按 index_langs 判断
- search/searcher: enable_translation 改为基于 index_languages 是否非空
- indexer: document_transformer 按 index_languages 填多语言字段；indexing_utils 仅多语言时初始化翻译器
- tests: 租户配置与索引测试改为断言 index_languages
- README: 更新 TODO 说明已支持 index_languages

2026-01-27 16:51:35 +0800

3a5fda00 1. ES字段 skus的 image_src 字段读取兼容 imageSrc （ES 本应该写入image_src，但是写入了imageSrc，暂时不做全量了，这里兼容下） ... Browse File »
```
2. 返回query_normlized
```
tangwang
2026-01-27 10:24:14 +0800

20 Dec, 2025

1 commit

70dab99f add logs Browse File »

tangwang
2025-12-20 14:50:13 +0800

19 Dec, 2025

1 commit

b2e50710 BgeEncoder.encode(...) 返回：np.ndarray(dtype=object)，每个元素要么是 np.ndarray，要么是 None。 ... Browse File »
```
cache/service 任一环节返回坏 embedding（含 NaN/Inf/空/非 ndarray）都会 视为 None，并且坏 cache 会被自动删除。
```
tangwang
2025-12-19 18:05:59 +0800

18 Dec, 2025

2 commits

345d960b 1. 删除全局 enable_translation 配置 ... Browse File »

config/config_loader.py: 从 QueryConfig 类中删除 enable_translation 字段
config/config.yaml: 删除 enable_translation: true 配置项
config/config_loader.py: 从 to_dict() 方法中删除相关输出
2. 索引阶段（离线）- 使用租户配置
indexer/indexing_utils.py:
根据 tenant_config.translate_to_en 和 translate_to_zh 决定是否初始化 translator
只有任一方向开启时才创建 translator
indexer/document_transformer.py:
_fill_text_fields 从 tenant_config 读取 translate_to_en 和 translate_to_zh
调用 translate_for_indexing 时传递这两个参数
更新了文档注释
3. 查询阶段（在线）- 使用租户配置
query/query_parser.py:
parse() 方法新增 tenant_id 参数
根据租户配置决定翻译目标语言（translate_to_zh / translate_to_en）
如果两个都是 false，跳过翻译阶段
translator 属性不再依赖 enable_translation，总是可以初始化
search/searcher.py:
search() 方法中根据租户配置计算 enable_translation（用于日志和 metadata）
调用 query_parser.parse() 时传递 tenant_id
4. 翻译器方法更新
query/translator.py:
translate_for_indexing() 新增 translate_to_en 和 translate_to_zh 参数（默认 True 保持向后兼容）
根据这两个参数决定翻译目标
更新了文档注释

2025-12-18 19:18:28 +0800

3ec5bfe6 1. get_translation_needs这种函数可以去除。逻辑直接写在parse函数中。 ... Browse File »

2. translate_multi 还需要提供一种调用方法，异步的，但是 可以等待结果的。
3. 如果detected_lang不是en也不是zh，这时候， 我们调用translate_multi  是需要等待结果返回的（因为是zh 或者 en 都有一个索引字段可以查，因此 本次可以不用结果，直接去走搜索，但是如果两者都不是，只能等待翻译结果。）
4. parse函数 这里可能发起一个异步的调用，下面的encode也要做成异步的，这样 encode和翻译两个异步任务的时间可以重叠，需要等待所有结果都返回。

更改
1. 去除 get_translation_needs 函数，逻辑内联到 parse 函数
在 parse 函数中（第230-234行）直接实现了 get_translation_needs 的逻辑
2. 添加 translate_multi_async 方法，支持异步等待结果
在 translator.py 中添加了 translate_multi_async 方法（第412-459行）
该方法返回字典，值为翻译字符串（缓存命中）或 Future 对象（需要等待）
3. 根据 detected_lang 决定是否需要等待翻译结果
如果 detected_lang 不是 'en' 也不是 'zh'，使用 translate_multi_async 并等待结果（第245-261行）
如果是 'en' 或 'zh'，使用 translate_multi 的异步模式，不等待结果（第262-273行）
4. 将 encode 和翻译改为异步并行执行
encode 使用 ThreadPoolExecutor 异步执行（第315-330行）
翻译和编码任务并行执行，使用 as_completed 等待所有结果（第332-375行）

2025-12-18 15:00:18 +0800

08 Dec, 2025

1 commit

a5a6bab8 多语言查询优化 Browse File »

tangwang
2025-12-08 11:47:58 +0800

07 Dec, 2025

2 commits

0064e946 feat: 增量索引服务、租户配置和翻译功能集成 ... Browse File »

主要功能：
1. 增量数据获取服务
   - 新增 IncrementalIndexerService 提供单个SPU数据获取
   - 新增 /indexer/spu/{spu_id} API接口
   - 服务启动时预加载分类映射等公共数据
   - 提取 SPUDocumentTransformer 统一全量和增量转换逻辑
   - 支持根据租户配置进行语言处理和翻译

3. 租户配置系统
   - 租户配置合并到统一配置文件 config/config.yaml
   - 支持每个租户独立配置主语言和翻译选项
   - 租户162配置为翻译关闭（用于测试）

4. 翻译功能集成
   - 翻译提示词作为DeepL API的context参数传递
   - 支持中英文提示词配置
   - 索引场景：同步翻译，使用缓存
   - 查询场景：异步翻译，立即返回

测试：
- 新增 indexer/test_indexing.py 和 query/test_translation.py
- 验证租户162翻译关闭功能
- 验证全量和增量索引功能

2025-12-07 11:11:12 +0800

6e0e310c 1. Translator 类增强 ... Browse File »

添加 ThreadPoolExecutor 线程池用于异步翻译
修改 translate_multi() 方法，支持 async_mode 参数（默认 True）
添加 _get_cached_translation() 方法，快速获取缓存
添加 _translate_async() 方法，异步执行翻译任务
2. 异步翻译逻辑
命中缓存：立即返回缓存结果
未命中缓存：
异步启动翻译任务（不阻塞）
返回 None（本次查询不使用）
翻译完成后自动存入缓存
下次查询时可直接使用缓存结果
3. QueryParser 更新
调用 translate_multi() 时使用 async_mode=True
过滤掉 None 值（未完成的翻译）
优化日志输出，区分缓存命中和异步翻译
工作流程
首次查询：未命中缓存 → 异步翻译 → 返回空翻译 → 不阻塞
翻译完成：结果存入缓存
后续查询：命中缓存 → 立即返回 → 快速响应

2025-12-07 09:14:47 +0800

05 Dec, 2025

1 commit

7bc756c5 优化 ES 查询构建 ... Browse File »

将 must 子句改为 should 子句的多查询策略
实现以下查询类型：
base_query：主查询，使用 AND 操作符和 75% minimum_should_match
翻译查询：跨语言查询，boost=0.4
短语查询：短查询的精确短语匹配
关键词查询：基于提取名词的查询，boost=0.1
添加 _get_match_fields() 方法，支持中英文字段动态映射
4. 关键改进点
minimum_should_match 从 67% 提升到 75%
添加 operator: "AND" 确保所有词都匹配
使用 should 子句实现多策略融合
支持短语查询和关键词查询的智能触发

2025-12-05 22:54:06 +0800

02 Dec, 2025

1 commit

9f96d6f3 短query不用语义搜索 ... Browse File »
```
query config/ranking config优化
```
tangwang
2025-12-02 13:38:31 +0800

26 Nov, 2025

1 commit

bf89b597 feat(search): adapt engine to new SPU-level index, mapping and facets Browse File »

tangwang
2025-11-26 21:18:58 +0800

14 Nov, 2025

1 commit

325eec03 1. 日志、配置基础设施，使用优化 ... Browse File »
```
2. 向量服务不用本地预估，改用网络服务
```
tangwang
2025-11-14 10:39:49 +0800

13 Nov, 2025

2 commits

522a3964 多语言搜索翻译的优化（deepL添加上下文提示词） Browse File »

tangwang
2025-11-13 15:59:22 +0800
9cb7528e 店匠体系数据的搜索:mock data -> mysql, mysql->ES Browse File »

tangwang
2025-11-13 15:13:26 +0800