Files
agent-park/docs/integrations/n8n/workflows/05-project-description-vectorization.md
T

1.8 KiB

项目描述向量化

  • Registry ID: project-description-vectorization
  • n8n Workflow ID: 1AvejnM5n-WPApU1vFt9C
  • Status: confirmed
  • 角色: 为项目生成 embedding,供语义检索工作流使用。

触发方式

  • 定时触发
  • 当前已核查行为:约每 30 分钟运行一次

数据来源

  • projects 表中的活跃项目
  • SiliconFlow Embeddings API
  • 模型:BAAI/bge-m3

主流程

  1. 选出 embedding IS NULL 或需要补算的活跃项目。
  2. 读取项目的中英文名称、描述和正文。
  3. 拼接向量化输入文本。
  4. 调用 SiliconFlow Embeddings API 生成向量。
  5. 直接写回 projects.embeddingembeddingUpdatedAt

直接写入字段

  • projects.embedding
  • projects.embeddingUpdatedAt

与仓库的关系

这条流程直接维护数据库向量列,而不是通过仓库 API 写入。仓库侧主要消费点:

下游影响

  • RAG项目搜索
  • 语义搜索命中质量
  • 以自然语言搜索项目的相关性

已确认要点

  • 已通过 live n8n MCP 核查 workflow 元数据与职责。
  • 当前实现是直连数据库维护向量列。
  • 所以如果 AI 搜索结果变差,既要查 webhook 搜索流程,也要查这条补向量流程是否落后或失败。

维护要求

  • 向量输入字段、模型、补算规则变化时,同步更新 registry.json
  • 如果后续 embedding 改成异步队列或应用内任务,需要把这里的数据库直写描述同步改掉。