ai-saas / saas-search

10 Mar, 2026

4 commits

bcada818 last Browse File »

tangwang
2026-03-10 16:17:18 +0800

bd96cead 1. 动态多语言字段与统一策略配置 ... Browse File »

- 配置改为“字段基名 + 动态语言后缀”方案，已不再依赖旧 `indexes`。
[config.yaml](/data/saas-search/config/config.yaml#L17)
- `search_fields` / `text_query_strategy` 已进入强校验与解析流程。
[config_loader.py](/data/saas-search/config/config_loader.py#L254)

2. 查询语言计划与翻译等待策略
- `QueryParser` 现在产出
  `query_text_by_lang`、`search_langs`、`source_in_index_languages`。
[query_parser.py](/data/saas-search/query/query_parser.py#L41)
- 你要求的两种翻译路径都在：
  - 源语言不在店铺 `index_languages`：`translate_multi_async` + 等待
    future
  - 源语言在 `index_languages`：`translate_multi(...,
    async_mode=True)`，尽量走缓存
[query_parser.py](/data/saas-search/query/query_parser.py#L284)

3. ES 查询统一文本策略（无 AST 分支）
- 主召回按 `search_langs` 动态拼 `field.{lang}`，翻译语种做次权重
  `should`。
[es_query_builder.py](/data/saas-search/search/es_query_builder.py#L454)
- 布尔 AST 路径已删除，仅保留统一文本策略。
[es_query_builder.py](/data/saas-search/search/es_query_builder.py#L185)

4. LanguageDetector 优化
- 从“拉丁字母默认英文”升级为：脚本优先 +
  拉丁语系打分（词典/变音/后缀）。
[language_detector.py](/data/saas-search/query/language_detector.py#L68)

5. 布尔能力清理（补充）
- 已删除废弃模块：
[boolean_parser.py](/data/saas-search/search/boolean_parser.py)
- `search/__init__` 已无相关导出。
[search/__init__.py](/data/saas-search/search/__init__.py)

6. `indexes` 过时收口（补充）
- 兼容函数改为基于动态字段生成，不再依赖 `config.indexes`。
[utils.py](/data/saas-search/config/utils.py#L24)
- Admin 配置接口改为返回动态字段配置，不再暴露 `num_indexes`。
[admin.py](/data/saas-search/api/routes/admin.py#L52)

7. suggest

2026-03-10 16:06:31 +0800

24e92141 delete enable_multilang_search Browse File »

tangwang
2026-03-10 13:12:56 +0800
26b910bd refactor service init and tighten multi-tenant search contracts Browse File »

tangwang
2026-03-10 13:09:24 +0800

09 Mar, 2026

1 commit

ed948666 tidy Browse File »

tangwang
2026-03-09 17:04:00 +0800

11 Feb, 2026

1 commit

ea118f2b build_query：根据 query_tokens 调整 KNN 参数： ... Browse File »

短查询（token_count ≤ 2）：knn_k=30, num_candidates=100, boost=0.15（约原权重 0.6）
中等查询（3–4）：knn_k=50, num_candidates=200, boost=0.25（默认）
长查询（token_count ≥ 5）：knn_k=80, num_candidates=300, boost=0.35（约原权重 1.4）

2026-02-11 18:41:00 +0800

06 Feb, 2026

1 commit

985d7fe3 为 filters 中所有字段加上 `*_all` 语义 ... Browse File »

---

 1. `search/es_query_builder.py`：`_all` 分支

- **普通字段**（如 `tags_all`, `category1_name_all`）：
  - 键以 `_all` 结尾时，先去掉后缀得到 ES 字段名。
  - 若值为**数组**：生成 `bool.must`，内含多个 `term`，即多值 **AND**。
  - 若值为**单值**：生成一个 `term`。
- **specifications_all**：
  - 值为 `[{name, value}, ...]` 时，为每一项生成一个 nested 查询，全部放入同一个 `bool.must`，即列表内所有规格条件都要满足（AND）。

原有逻辑不变：不带 `_all` 的字段，数组仍为 OR（`terms`），单值仍为 `term`。

 2. `api/models.py`：filters 说明

- 在 `filters` 的 `description` 中补充：
  - 字段名加 `_all` 表示 AND（如 `tags_all: ['A','B']` 表示同时包含 A 和 B）。
  - `specifications_all` 表示列表内所有规格条件都要满足。

 3. `docs/搜索API对接指南.md`：文档

- 在 3.3.1 开头说明：任意字段名可加 `_all` 后缀表示多值 AND。
- 在格式示例中增加 `tags_all`、`category1_name_all` 示例。
- 在「支持的值类型」中说明：数组在带 `_all` 时为 AND。
- 新增小节「`*_all` 语义（多值 AND）」：说明用法及 `specifications_all` 行为。
- 在「常用过滤字段」中补充：以上字段均可加 `_all` 后缀。

---

**使用示例**

```json
{
  "filters": {
    "tags": ["手机", "促销"],
    "tags_all": ["手机", "促销", "新品"]
  }
}
```

- `tags`：命中「手机」或「促销」或两者都有（OR）。
- `tags_all`：必须同时包含「手机」「促销」「新品」三个标签（AND）。

2026-02-06 11:23:06 +0800

06 Jan, 2026

2 commits

2739b281 多语言索引调整 Browse File »

tangwang
2026-01-06 19:59:36 +0800

d7d48f52 改动（mapping + 灌入结构） ... Browse File »

mappings/search_products.json：把原来的 title_zh/title_en/brief_zh/... 改成 按语言 key 的对象结构（ /products/_doc/1 { "title": {"en":...} } ）
同时在这些字段下 预置了全部 analyzer 语言:
arabic, armenian, basque, brazilian, bulgarian, catalan, chinese, cjk, czech, danish, dutch, english, finnish, french, galician, german, greek, hindi, hungarian, indonesian, italian, norwegian, persian, portuguese, romanian, russian, spanish, swedish, turkish, thai

实现为 type: object + properties，同时满足“按语言灌入”和“按语言 analyzer”。
索引灌入（全量/增量/transformer）已同步改完
indexer/document_transformer.py：输出从 title_zh/title_en/... 改为：
title: {<primary_lang>: 原文, en?: 翻译, zh?: 翻译}
brief/description/vendor 同理
category_path/category_name_text 也改为语言对象（避免查询侧继续依赖旧字段）
indexer/incremental_service.py：embedding 取值从 title_en/title_zh 改为从 title 对象里优先取 en，否则取 zh，否则取任一可用语言。
查询侧与配置、API/文档已同步
search/es_query_builder.py：查询字段统一改成点路径：title.zh / title.en / vendor.zh / vendor.zh.keyword / category_name_text.zh 等。
config/config.yaml：field boosts / indexes 里的字段名同步为新点路径。
API & formatter：
api/result_formatter.py 已支持新结构（并保留对旧 *_zh/_en 的兼容兜底）。
api/models.py、相关 docs/examples 里的 vendor_zh.keyword 等已更新为 vendor.zh.keyword。
文档/脚本：docs/、README.md、scripts/ 里所有旧字段名引用已批量替换为新结构。

2026-01-06 19:42:20 +0800

25 Dec, 2025

1 commit

d8ca3b13 修复分面结果各个选项结果数和实际不一致的问题（因为统计的是子文档个数） ... Browse File »

问题：nested 聚合统计的是嵌套文档（specifications 条目）数量，而不是产品（父文档）数量。
修复内容：
在 es_query_builder.py 中：为 specifications 分面的聚合添加了 reverse_nested 子聚合，用于统计产品数量：
   "aggs": {       "product_count": {           "reverse_nested": {}       }   }
在 result_formatter.py 中：更新读取逻辑，从 product_count.doc_count 读取产品数量，而不是直接使用 doc_count。
修复效果：
之前：分面显示 62（统计了 62 个嵌套文档/规格条目）
现在：分面显示实际的产品数量（例如 2），与搜索结果数量一致

2025-12-25 13:12:34 +0800

20 Dec, 2025

1 commit

70dab99f add logs Browse File »

tangwang
2025-12-20 14:50:13 +0800

08 Dec, 2025

1 commit

a5a6bab8 多语言查询优化 Browse File »

tangwang
2025-12-08 11:47:58 +0800

05 Dec, 2025

2 commits

7bc756c5 优化 ES 查询构建 ... Browse File »

将 must 子句改为 should 子句的多查询策略
实现以下查询类型：
base_query：主查询，使用 AND 操作符和 75% minimum_should_match
翻译查询：跨语言查询，boost=0.4
短语查询：短查询的精确短语匹配
关键词查询：基于提取名词的查询，boost=0.1
添加 _get_match_fields() 方法，支持中英文字段动态映射
4. 关键改进点
minimum_should_match 从 67% 提升到 75%
添加 operator: "AND" 确保所有词都匹配
使用 should 子句实现多策略融合
支持短语查询和关键词查询的智能触发

2025-12-05 22:54:06 +0800

9a9b9ec5 1. facet disjunctive ... Browse File »
```
2. queries
```
tangwang
2025-12-05 19:39:47 +0800

04 Dec, 2025

1 commit

c581becd feat: 实现 Multi-Select Faceting 和 Selected 状态标记 ... Browse File »

核心功能：
- 添加 multi_select 字段到 FacetConfig（默认为 true）
- 实现 post_filter 支持 disjunctive faceting
- 后端自动标记 facet 值的 selected 状态
- 支持 specifications 和普通字段的 multi-select

技术改进：
- ESQueryBuilder: 分离 conjunctive/disjunctive filters
- ResultFormatter: 根据 current_filters 标记 selected
- Searcher: 传递 facet_configs 给 query builder

文档更新：
- 添加 multi_select_faceting.md 详细文档
- 更新 API 对接指南，说明新功能
- 添加测试脚本 test_multi_select_facet.py

业界标准：
- 遵循 Elasticsearch/Algolia/Amazon 的最佳实践
- 提供探索式搜索体验
- 前后端职责清晰分离

2025-12-04 15:29:52 +0800

03 Dec, 2025

1 commit

13320ac6 分面接口修改： ... Browse File »

{
  "facets": [
    {
      "field": "category1_name",
      "size": 15,
      "type": "terms"
    },
    "specifications.color",
    "specifications.size"
  ]
}

{
  "facets": [
    {"field": "category1_name", "size": 15, "type": "terms"},
    {"field": "specifications.color", "size": 10, "type": "terms"},
    {"field": "specifications.size", "size": 10, "type": "terms"}
  ]
}

之前是上面的接口形式，主要是考虑 属性的分面， 因为 款式都是有限的 不需要设定 "size": 10, "type": "terms" 这些参数。

但是从接口设计层面，最好按下面这样，这样的话 specifications.color 和 category1_name 的组装格式 完全一样。前端不需要感知 属性分面 和 类别等其他字段分面的差异。

2025-12-03 21:20:50 +0800

02 Dec, 2025

1 commit

9f96d6f3 短query不用语义搜索 ... Browse File »
```
query config/ranking config优化
```
tangwang
2025-12-02 13:38:31 +0800

01 Dec, 2025

1 commit

85f08823 过滤逻辑 ... Browse File »
```
不同维度（不同的 name）：求交集
相同维度（相同的 name）：求并集
```
tangwang
2025-12-01 09:50:49 +0800

27 Nov, 2025

2 commits

f7d3cf70 更新文档 ... Browse File »

1. 搜索API对接指南.md
在“精确匹配过滤器”部分添加了 specifications 嵌套过滤说明
支持单个规格过滤和多个规格过滤（OR 逻辑）
在“分面配置”部分完善了 specifications 分面说明
添加了两种分面模式：所有规格名称和指定规格名称
在“常见场景示例”部分添加了场景5-8，包含规格过滤和分面的完整示例
2. 搜索API速查表.md
在“精确匹配过滤”部分添加了 specifications 过滤的快速参考
在“分面搜索”部分添加了 specifications 分面的快速参考
更新了完整示例，包含 specifications 的使用
3. Search-API-Examples.md
在“过滤器使用”部分添加了示例4-6，展示 specifications 过滤
在“分面搜索”部分添加了示例2-3，展示 specifications 分面
更新了 Python 和 JavaScript 完整示例，包含 specifications 的使用
在“常见使用场景”部分添加了场景2.1，展示带规格过滤的搜索结果页
4. 索引字段说明v2.md
更新了 specifications 字段的查询示例，包含 API 格式和 ES 查询结构
添加了两种分面模式的说明和示例
更新了“分面字段”说明，明确支持指定规格名称的分面

2025-11-27 11:04:14 +0800

f0d020c3 多语言查询改为只支持中英文两种，filters and ( text_call or embedding_recall)，然后 function_score 支持新鲜度等提权字段 ... Browse File »

1. 前端传递的过滤条件永远是要起作用的
2. 然后召回模块包括文本相关性召回（中英文都是用）和向量召回，两者相互补充。
3. 套用function_score以支持两种打分融合和各种提权字段
4. 只需要build_query 这一层。

实际操作：
1. 架构简化
移除了 MultiLanguageQueryBuilder 层级
只保留单层的 ESQueryBuilder.build_query 方法
2. 查询结构重构
实现了 filters and (text_recall or embedding_recall) 结构：
前端过滤条件：永远起作用（放在 filter 中）
文本召回：同时搜索中英文字段（multi_match 覆盖 title_zh/en, brief_zh/en 等）
向量召回：KNN 查询（独立参数，ES 会自动合并）
Function_score：包装召回部分，支持提权字段配置
3. 文本匹配字段更新
在 DEFAULT_MATCH_FIELDS 中添加了中英文字段：
中文：title_zh, brief_zh, description_zh, vendor_zh, category_path_zh, category_name_zh
英文：title_en, brief_en, description_en, vendor_en, category_path_en, category_name_en
语言无关：tags
4. Function_score 框架保留
保留了 function_score 配置框架（FUNCTION_SCORE_CONFIG）
支持 filter_weight、field_value_factor、decay 等提权函数
可以从配置中扩展提权字段
5. 测试验证
所有功能测试通过：
基本文本搜索
带过滤条件的搜索
范围过滤
分面搜索
英文查询

2025-11-27 09:12:44 +0800

26 Nov, 2025

1 commit

bf89b597 feat(search): adapt engine to new SPU-level index, mapping and facets Browse File »

tangwang
2025-11-26 21:18:58 +0800

12 Nov, 2025

4 commits

13377199 接口优化 Browse File »

tangwang
2025-11-12 21:27:07 +0800

43f1139f refactor: ES查询结构重构与类型系统优化 ... Browse File »

核心改动：
1. 修复facets类型问题
   - 统一使用Pydantic模型（FacetResult, FacetValue）
   - SearchResult.facets改为List[FacetResult]
   - _standardize_facets直接构建Pydantic对象

2. 修复RangeFilter支持日期时间
   - RangeFilter字段改为Union[float, str]
   - 支持数值范围和ISO日期时间字符串
   - 修复前端listing time筛选422错误

3. 重构ES查询结构（核心）
   - 使用function_score包裹整个查询
   - 文本和KNN放入内层bool.should（minimum_should_match=1）
   - Filter在外层bool，同时作用于文本和KNN查询
   - 添加时效性加权函数（days_since_last_update<=30 weight:1.1）

4. RankingEngine重构
   - 重命名为RerankEngine（语义更准确）
   - 默认禁用（enabled=False）
   - 优先使用ES的function_score打分

5. 统一约定原则
   - 移除所有字典兼容代码
   - 全系统统一使用Pydantic模型
   - build_facets只接受str或FacetConfig
   - _build_filters直接接受RangeFilter模型

修改文件：
- search/multilang_query_builder.py: 重构查询构建逻辑
- search/es_query_builder.py: 统一Pydantic模型支持
- search/searcher.py: 使用RerankEngine，更新导入
- search/rerank_engine.py: 新建（从ranking_engine.py重命名）
- search/ranking_engine.py: 删除
- search/__init__.py: 更新导出
- api/models.py: RangeFilter支持Union[float, str]

测试验证：
✓ Facets正常返回
✓ Filter同时作用于文本和KNN
✓ 日期时间范围过滤正常
✓ Function score时效性加权正常
✓ 所有测试通过

架构原则：统一约定，不做兼容，保持简单

2025-11-12 13:08:35 +0800

ff5325fa 修复：直接在 Searcher 层构建 Pydantic 模型对象，而不是字典。 Browse File »

tangwang
2025-11-12 12:17:01 +0800
6aa246be 问题：Pydantic 应该能自动转换字典到模型，但如果字典结构不完全匹配或验证失败，可能导致字段为空或验证错误被忽略。 Browse File »

tangwang
2025-11-12 11:21:41 +0800

11 Nov, 2025

1 commit

c86c8237 支持聚合。过滤项补充了逻辑，但是有问题 Browse File »

tangwang
2025-11-11 20:46:04 +0800

08 Nov, 2025

1 commit

be52af70 first commit Browse File »

tangwang
2025-11-08 00:07:09 +0800