Skip to content

关于llava_vid.py源码中add_time_instruction参数的讨论 #42

Description

@WuSakaid

尊敬的作者,您好!
我们正在将您对于lmms代码的调整迁移至lmms-eval v0.6版本。
在阅读您代码的过程中,我们发现在llava_vid.py中存在add_time_instruction这个参数。
我们之前也有类似的想法,即:原有的模型基本以均匀抽帧来阅读视频,抽取关键帧可能导致模型对于时间理解出现偏差。
然后发现您的代码已经有这种显式地将“视频总时长”、“采样了多少帧”以及“这些帧发生的具体时间点”作为文本指令,塞给语言模型的做法,然而这种做法只在llava_vid的代码中存在,而脚本也并没有使用这段代码。
我们想询问一下,为什么最后没用使用这种做法?您的团队有进行过这个做法的可行性分析和实际结果的分析吗?

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions