Skip to content

Latest commit

 

History

History
16 lines (9 loc) · 1.02 KB

README_zh.md

File metadata and controls

16 lines (9 loc) · 1.02 KB

视频Caption

通常,大多数视频数据不带有相应的描述性文本,因此需要将视频数据转换为文本描述,以提供必要的训练数据用于文本到视频模型。

通过 CogVLM2-Video 模型生成视频Caption

🤗 Hugging Face | 🤖 ModelScope | 📑 Blog💬 Online Demo

CogVLM2-Video 是一个多功能的视频理解模型,具备基于时间戳的问题回答能力。用户可以输入诸如 请详细描述这个视频 的提示语给模型,以获得详细的视频Caption:

用户可以使用提供的代码加载模型或配置 RESTful API 来生成视频Caption。