ai-saas / saas-search

20 Mar, 2026

2 commits

6823fe3e feat(search): 混合语种查询分析与跨语言字段召回 ... Browse File »

## 背景
多语言索引下，用户查询常中英混写；需在解析阶段显式标记脚本类型，并在 BM25 子句中同时覆盖对应语言字段。

## 方案

### 1. Query 分析（query_parser.ParsedQuery）
- 新增 `contains_chinese`：query 文本含 CJK（沿用 _contains_cjk）。
- 新增 `contains_english`：分词结果中存在「纯英文、len>=3」token（fullmatch 字母及可选连字符）。
- 写入 to_dict、请求 context 中间结果，便于调试与 API 透出。

### 2. ES 文本召回（es_query_builder._build_advanced_text_query）
- 对每个 search_lang 子句：若含英文且子句语言非 en（且租户 index_languages 含 en），合并 en 列字段；若含中文且子句语言非 zh（且含 zh），合并 zh 列字段。
- 合并进来的字段 boost 乘以 `mixed_script_merged_field_boost_scale`（默认 0.8，可在 ESQueryBuilder 构造参数调整）。
- fallback_original_query_* 分支同样应用上述逻辑。

### 3. 实现整理
- 引入 `MatchFieldSpec = (field_path, boost)`：`_build_match_field_specs` 为唯一权重来源；`_merge_supplemental_lang_field_specs` / `_expand_match_field_specs_for_mixed_script` 在 tuple 上合并与缩放；最后 `_format_match_field_specs` 再格式化为 ES `path^boost`，避免先拼字符串再解析。

## 测试
- tests/test_query_parser_mixed_language.py：脚本标记与 token 规则。
- tests/test_es_query_builder.py：合并字段、0.8 缩放、index_languages 限制。

Made-with: Cursor

2026-03-20 14:45:57 +0800

1556989b query翻译等待超时逻辑 Browse File »

tangwang
2026-03-20 14:29:57 +0800

18 Mar, 2026

1 commit

a8261ece 检索效果优化 Browse File »

tangwang
2026-03-18 10:55:57 +0800