
就在刚刚, 有一个开源项目, 该项目名为claude-real-video, 宣称能够实现一种效果, 即让任何大语言模型都能“观看”视频。

此项目未曾开展训练全新的视频模型, 亦不存在复杂的视觉推理框架, 其star数量的上升速率极为迅速!

AI于分析 YouTube 视频之际, 难道实际真切完完全全地将视频给“看”上了一回吗。它到底有没有实实在在彻彻底底地把视频浏览一番啊。
对一个时长为几十分钟的视频来讲, 要是把当中每一帧都传送给模型, 不但 Token 成本会变得极高, 并且还会远远超过模型所能够处理的上下文长度。
故而, 不管是Claude, 亦或是GPT, 再或者是Gemini, 当面对一个视频链接之际, 它们更多所依赖的乃是视频字幕, 而非切实去理解画面。
也就是说,模型听到了声音开云真人app官网入口,却没有真正看到画面。
那么这个项目是怎么做到的?
核心思路:不是抽帧更多,而是抽帧更聪明
克劳德-真实视频的这种思考路线并不是极为繁杂, 它并非是要促使克劳德去播放视频, 而是先在本地开展一回“视频理解预先处理”。
整个流程大概如下这般: 首先, 去通过yt-dlp或者使用本地文件来获取视频源, 之后, 运用ffmpeg去进行场景检测、提取关键性的帧、对图片进行去重操作, 与此同时, 借助Whisper(或者视频自身所带的字幕来生成文字转录内容, 最后精心打包装制成frames/特定的关键帧图片、transcript.txt转录文本、MANIFEST.txt列出明细的这种清单文件三种物品。
最末, 将这些文件一并交付给Claude、GPT、Gemini, 它们并非径直读取视频, 而是于同一情境里同时阅览: 视频字幕, 每个场景的关键帧图片, 每张图片所对应的时间轴信息。
这样一来,它获得的信息远比单纯依赖字幕丰富得多。
拆解项目五大亮点,每一步都在省 Token

通常传统的视频抽帧方式是固定频率, 比如说, 每秒抽一帧。要是一个PPT页面停留了30秒, 那么就会得到30张几乎完全一样的图片。然而这样做既浪费Token, 又没有任何价值。
反观claude-real-video, 其所采用的乃是Scene Detection(场景检测)。
只有当画面真正发生变化时,才保存新的关键帧。
在主页, 存在另外一个案例, 那是相同是58秒时长的视频片段的情况, 其固定1fps采集频率这种状况下等于58帧 , claude - real - video留存了实际不一样的26帧 , grid把它们整理成3个联系表这样的形式 , token数量变的更少了 , 然而却没有遗漏任何一点信息。

第二个亮点:自动删除重复图片
模型不具有那种反复去阅读相同画面的必要性, 所以呢, 项目另外增添了图片去重机制: 借由滑动窗口来比较相邻图片之间的相似度, 以此来只不过保留切实发生了变化的各类内容。
比如说, 这儿有一百张图片, 最终大概仅仅会留下三十张。就Claude而言, 理解的效果基本上没存有变化, 可是Token的消耗却有明显下降。
第三个亮点:让画面和字幕真正对应起来
会生成一个项目的MANIFEST文件, 对每一张关键帧所对应的时间戳, 与每一段字幕的时间戳进行关联起来, 如此模型所面对的便不是一堆处于散乱状态的图片, 而是能够清晰知晓“在某句话说出口的时刻, 当时画面精确呈现的正好是哪一张图”。
第四个亮点:关键帧并不等于视频
新版本新增了一个很聪明的设计:“关键帧并不等于视频。”

只因单张图片仅能展现某片刻, 大量动作、动画以及UI变化, 皆于连续数帧之际发生了。
于是, 项目迅速又推出了新的Grid功能, 它会将连续的9张关键帧拼接成一张图片, 使模型能够一次性读取一段连续的画面序列, 可不是零散的静态截图, 如此一来还有一个额外的好处, 先前提到的26张关键帧, 能够进一步被压缩成3张图, Token消耗又降低了一截。

第五个亮点:不只是总结视频,而是带着目标去分析
以0.3.0的版本而言, 增添了一个全新的参数why, 能够于命令行当中直接向工具表明‘你为什么要看这段视频’, 例如:
crv "https://youtu.be/..." --why "find the pricing strategy" --kb ~/notes
与所提及的事物相配套的, 还有一个 kb 参数, 它能够将分析得出的结果, 保存放置于你自身的知识库, 也就是 notes 文件夹当中, 并且会依据日期进行命名这样一来,结果便不会因为 crv - out 目录被清理而就此消失不见。
免费版之外,还有一个付费的 crv Pro
还有一点, claude-real-video开源免费的这一部分, 所进行的工作是"让模型能够看到视频", 这也正是之前所提到的场景抽帧, 还有经过去重处理, 之后要进行拼图操作, 最后还要完成时间轴对齐。项目主页还在推广一款需一次性付费(19 美元)的 crv Pro, 其主打“使模型能够看懂视频”, 像识别镜头运镜的方式(固定机位、摇镜、推拉、手持), 统计剪辑的节奏, 生成一份画面之外的“感知时间轴”, 记录那些仅靠看画面无法推断出来的信息, 像手势、表情、语气变化、情绪、非语音的声音事件, 还要配上一份面向短视频创作者的分析报告等。

网友:应该去掉项目名字里的Claude!
对于这个开源工具世界杯直播观看,网友的评论大多分两种。
一种是赞同项目的思路:
“这看起来很酷开云app在线入口,开云真人官方下载,但是应该去掉名字里的Claude。”
“我认为这比单纯的 LLM 相关应用更有用。”
也有网友对这个项目的一些技术方面提出疑问:
我有着使用ffmpeg场景检测方面的经验, 这个经验表明它是很不稳定的了。它存在着有时有效的情况, 然而却绝不是可靠的样子。

写在最后
过去,我们总希望等待模型原生支持更长的视频输入。
而这个项目提供了另一种路线:不是升级模型,而是升级上下文。
模型所接收到的信息, 被预先组织成了最为适宜理解的形式, 往后, 不管是视频, 还是网页, 亦或是代码仓库, 甚至是长文档, 我们或许都无需等待模型“原生支持”。
要是能够将信息整理成模型极为易于理解的上下文, 一样能够取得近乎原生能力的成效。
标签: AI视频分析 开源项目 场景检测 关键帧提取 上下文理解
还木有评论哦,快来抢沙发吧~