CLIP Embedding — 多模态向量化服务

概述

基于 OpenAI CLIP ViT-H-14 的多模态嵌入服务,将文本和图像编码为统一的 1024 维向量空间,实现图文跨模态检索。

模型

  • BAAI/CLIP-ViT-H-14 (OpenCLIP)
  • 向量维度: 1024
  • GPU: 部署于 GPU 服务器

API

端点 方法 说明
/api/status GET 服务状态和模型信息
/api/text POST 文本 → 向量
/api/image POST 图片 → 向量
/api/similarity POST 文本-图片相似度计算

请求示例

POST /api/text
{"texts": ["一只猫坐在沙发上", "日落海滩"]}

POST /api/image
{"images": ["base64图片数据"]}

部署

cd /data/ymq/clip_embedding
bash build.sh
sudo systemctl restart clip

端口

9086

Description
No description provided
Readme 37 KiB
Languages
Shell 54.9%
Python 45.1%