embedding.go 3.7 KB

123456789101112131415161718192021222324252627282930313233343536373839404142434445464748495051525354555657585960616263646566676869707172737475767778798081828384858687888990919293949596979899100101102103
  1. package rag
  2. import (
  3. "context"
  4. "fmt"
  5. "log"
  6. "github.com/2930134478/AI-CS/backend/service/embedding"
  7. )
  8. // DocumentEmbeddingService 文档向量化服务
  9. type DocumentEmbeddingService struct {
  10. vectorStoreService *VectorStoreService
  11. embeddingProvider embedding.EmbeddingProvider
  12. }
  13. // NewDocumentEmbeddingService 创建文档向量化服务实例(使用 provider 实现配置保存即生效)
  14. func NewDocumentEmbeddingService(vectorStoreService *VectorStoreService, embeddingProvider embedding.EmbeddingProvider) *DocumentEmbeddingService {
  15. return &DocumentEmbeddingService{
  16. vectorStoreService: vectorStoreService,
  17. embeddingProvider: embeddingProvider,
  18. }
  19. }
  20. // EmbedDocument 向量化单个文档并存储
  21. func (s *DocumentEmbeddingService) EmbedDocument(ctx context.Context, documentID uint, knowledgeBaseID uint, content string) error {
  22. svc, err := s.embeddingProvider.Get(ctx)
  23. if err != nil {
  24. return fmt.Errorf("获取嵌入服务失败: %w", err)
  25. }
  26. // 向量化
  27. vectors, err := svc.EmbedTexts(ctx, []string{content})
  28. if err != nil {
  29. return fmt.Errorf("文档向量化失败: %w", err)
  30. }
  31. if len(vectors) == 0 {
  32. return fmt.Errorf("未返回向量")
  33. }
  34. // 存储向量
  35. docIDStr := ConvertDocumentID(documentID)
  36. kbIDStr := ConvertKnowledgeBaseID(knowledgeBaseID)
  37. if err := s.vectorStoreService.UpsertVector(ctx, docIDStr, kbIDStr, content, vectors[0]); err != nil {
  38. return fmt.Errorf("存储向量失败: %w", err)
  39. }
  40. return nil
  41. }
  42. // EmbedDocuments 批量向量化文档并存储
  43. func (s *DocumentEmbeddingService) EmbedDocuments(ctx context.Context, documentIDs []uint, knowledgeBaseIDs []uint, contents []string) error {
  44. if len(documentIDs) != len(knowledgeBaseIDs) || len(documentIDs) != len(contents) {
  45. return fmt.Errorf("参数长度不匹配")
  46. }
  47. svc, err := s.embeddingProvider.Get(ctx)
  48. if err != nil {
  49. return fmt.Errorf("获取嵌入服务失败: %w", err)
  50. }
  51. // 诊断日志:批量向量化前,我们传给 EmbedTexts 的文档/内容条数
  52. log.Printf("[嵌入] EmbedDocuments 调用前: len(documentIDs)=%d, len(contents)=%d(若 contents 已是多条,说明上游在发请求前做了分块)", len(documentIDs), len(contents))
  53. // 批量向量化
  54. vectors, err := svc.EmbedTexts(ctx, contents)
  55. if err != nil {
  56. return fmt.Errorf("批量向量化失败: %w", err)
  57. }
  58. log.Printf("[嵌入] EmbedDocuments 调用后: len(vectors)=%d, len(contents)=%d", len(vectors), len(contents))
  59. if len(vectors) != len(contents) {
  60. log.Printf("[嵌入] 向量数与内容数不一致,将报错: 我们按 %d 行写入 Milvus 会与 embedding 列 %d 行冲突", len(contents), len(vectors))
  61. return fmt.Errorf("向量数量不匹配")
  62. }
  63. // 转换 ID
  64. docIDStrs := make([]string, len(documentIDs))
  65. kbIDStrs := make([]string, len(knowledgeBaseIDs))
  66. for i, id := range documentIDs {
  67. docIDStrs[i] = ConvertDocumentID(id)
  68. }
  69. for i, id := range knowledgeBaseIDs {
  70. kbIDStrs[i] = ConvertKnowledgeBaseID(id)
  71. }
  72. // 批量存储向量
  73. if err := s.vectorStoreService.UpsertVectors(ctx, docIDStrs, kbIDStrs, contents, vectors); err != nil {
  74. return fmt.Errorf("批量存储向量失败: %w", err)
  75. }
  76. return nil
  77. }
  78. // DeleteDocumentEmbedding 删除文档的向量
  79. func (s *DocumentEmbeddingService) DeleteDocumentEmbedding(ctx context.Context, documentID uint) error {
  80. docIDStr := ConvertDocumentID(documentID)
  81. return s.vectorStoreService.DeleteVector(ctx, docIDStr)
  82. }
  83. // DeleteDocumentEmbeddings 批量删除文档的向量
  84. func (s *DocumentEmbeddingService) DeleteDocumentEmbeddings(ctx context.Context, documentIDs []uint) error {
  85. docIDStrs := make([]string, len(documentIDs))
  86. for i, id := range documentIDs {
  87. docIDStrs[i] = ConvertDocumentID(id)
  88. }
  89. return s.vectorStoreService.DeleteVectors(ctx, docIDStrs)
  90. }