JLNTV_IPD/CogVideo

mirror of https://github.com/THUDM/CogVideo.git synced 2025-04-06 03:57:56 +08:00

huangshiyu a58692e3a7 update caption readme

2024-08-06 11:21:46 +08:00

1.0 KiB

Raw Blame History

视频Caption

通常，大多数视频数据不带有相应的描述性文本，因此需要将视频数据转换为文本描述，以提供必要的训练数据用于文本到视频模型。

通过 CogVLM2-Video 模型生成视频Caption

🤗 Hugging Face | 🤖 ModelScope | 📑 Blog ｜ 💬 Online Demo

CogVLM2-Video 是一个多功能的视频理解模型，具备基于时间戳的问题回答能力。用户可以输入诸如 请详细描述这个视频 的提示语给模型，以获得详细的视频Caption：

用户可以使用提供的代码加载模型或配置 RESTful API 来生成视频Caption。