CogVideo/tools/caption/README_zh.md
2024-08-06 11:21:46 +08:00

1.0 KiB
Raw Blame History

视频Caption

通常,大多数视频数据不带有相应的描述性文本,因此需要将视频数据转换为文本描述,以提供必要的训练数据用于文本到视频模型。

通过 CogVLM2-Video 模型生成视频Caption

🤗 Hugging Face | 🤖 ModelScope | 📑 Blog 💬 Online Demo

CogVLM2-Video 是一个多功能的视频理解模型,具备基于时间戳的问题回答能力。用户可以输入诸如 请详细描述这个视频 的提示语给模型以获得详细的视频Caption

用户可以使用提供的代码加载模型或配置 RESTful API 来生成视频Caption。