43 lines
818 B
Markdown
43 lines
818 B
Markdown
# CLIP Embedding — 多模态向量化服务
|
|
|
|
## 概述
|
|
|
|
基于 OpenAI CLIP ViT-H-14 的多模态嵌入服务,将文本和图像编码为统一的 1024 维向量空间,实现图文跨模态检索。
|
|
|
|
## 模型
|
|
|
|
- BAAI/CLIP-ViT-H-14 (OpenCLIP)
|
|
- 向量维度: 1024
|
|
- GPU: 部署于 GPU 服务器
|
|
|
|
## API
|
|
|
|
| 端点 | 方法 | 说明 |
|
|
|------|------|------|
|
|
| /api/status | GET | 服务状态和模型信息 |
|
|
| /api/text | POST | 文本 → 向量 |
|
|
| /api/image | POST | 图片 → 向量 |
|
|
| /api/similarity | POST | 文本-图片相似度计算 |
|
|
|
|
## 请求示例
|
|
|
|
```json
|
|
POST /api/text
|
|
{"texts": ["一只猫坐在沙发上", "日落海滩"]}
|
|
|
|
POST /api/image
|
|
{"images": ["base64图片数据"]}
|
|
```
|
|
|
|
## 部署
|
|
|
|
```bash
|
|
cd /data/ymq/clip_embedding
|
|
bash build.sh
|
|
sudo systemctl restart clip
|
|
```
|
|
|
|
## 端口
|
|
|
|
9086
|