Chat GPT真的能看懂视频?开源项目让AI看视频真相揭秘

admin AI新闻 24

编辑 | 林芯

就在刚刚, 有一个开源项目, 该项目名为claude-real-video, 宣称能够实现一种效果, 即让任何大语言模型都能“观看”视频。

Chat GPT真的能看懂视频?开源项目让AI看视频真相揭秘-第2张图片-世界杯直播平台-世界杯2026直播平台-免费观看官方-V3.6.9

此项目未曾开展训练全新的视频模型, 亦不存在复杂的视觉推理框架, 其star数量的上升速率极为迅速!

Chat GPT真的能看懂视频?开源项目让AI看视频真相揭秘-第3张图片-世界杯直播平台-世界杯2026直播平台-免费观看官方-V3.6.9

AI于分析 YouTube 视频之际, 难道实际真切完完全全地将视频给“看”上了一回吗。它到底有没有实实在在彻彻底底地把视频浏览一番啊。

对一个时长为几十分钟的视频来讲, 要是把当中每一帧都传送给模型, 不但 Token 成本会变得极高, 并且还会远远超过模型所能够处理的上下文长度。

故而, 不管是Claude, 亦或是GPT, 再或者是Gemini, 当面对一个视频链接之际, 它们更多所依赖的乃是视频字幕, 而非切实去理解画面。

也就是说,模型听到了声音开云真人app官网入口,却没有真正看到画面。

那么这个项目是怎么做到的?

核心思路:不是抽帧更多,而是抽帧更聪明

克劳德-真实视频的这种思考路线并不是极为繁杂, 它并非是要促使克劳德去播放视频, 而是先在本地开展一回“视频理解预先处理”。

整个流程大概如下这般: 首先, 去通过yt-dlp或者使用本地文件来获取视频源, 之后, 运用ffmpeg去进行场景检测、提取关键性的帧、对图片进行去重操作, 与此同时, 借助Whisper(或者视频自身所带的字幕来生成文字转录内容, 最后精心打包装制成frames/特定的关键帧图片、transcript.txt转录文本、MANIFEST.txt列出明细的这种清单文件三种物品。

最末, 将这些文件一并交付给Claude、GPT、Gemini, 它们并非径直读取视频, 而是于同一情境里同时阅览: 视频字幕, 每个场景的关键帧图片, 每张图片所对应的时间轴信息。

这样一来,它获得的信息远比单纯依赖字幕丰富得多。

拆解项目五大亮点,每一步都在省 Token

最大的亮点:不是每秒截图,而是“按场景提帧”

通常传统的视频抽帧方式是固定频率, 比如说, 每秒抽一帧。要是一个PPT页面停留了30秒, 那么就会得到30张几乎完全一样的图片。然而这样做既浪费Token, 又没有任何价值。

反观claude-real-video, 其所采用的乃是Scene Detection(场景检测)。

只有当画面真正发生变化时,才保存新的关键帧。

在主页, 存在另外一个案例, 那是相同是58秒时长的视频片段的情况, 其固定1fps采集频率这种状况下等于58帧 , claude - real - video留存了实际不一样的26帧 , grid把它们整理成3个联系表这样的形式 , token数量变的更少了 , 然而却没有遗漏任何一点信息。

Chat GPT真的能看懂视频?开源项目让AI看视频真相揭秘-第5张图片-世界杯直播平台-世界杯2026直播平台-免费观看官方-V3.6.9

第二个亮点:自动删除重复图片

模型不具有那种反复去阅读相同画面的必要性, 所以呢, 项目另外增添了图片去重机制: 借由滑动窗口来比较相邻图片之间的相似度, 以此来只不过保留切实发生了变化的各类内容。

比如说, 这儿有一百张图片, 最终大概仅仅会留下三十张。就Claude而言, 理解的效果基本上没存有变化, 可是Token的消耗却有明显下降。

第三个亮点:让画面和字幕真正对应起来

会生成一个项目的MANIFEST文件, 对每一张关键帧所对应的时间戳, 与每一段字幕的时间戳进行关联起来, 如此模型所面对的便不是一堆处于散乱状态的图片, 而是能够清晰知晓“在某句话说出口的时刻, 当时画面精确呈现的正好是哪一张图”。

第四个亮点:关键帧并不等于视频

新版本新增了一个很聪明的设计:“关键帧并不等于视频。”

Chat GPT真的能看懂视频?开源项目让AI看视频真相揭秘-第6张图片-世界杯直播平台-世界杯2026直播平台-免费观看官方-V3.6.9

只因单张图片仅能展现某片刻, 大量动作、动画以及UI变化, 皆于连续数帧之际发生了。

于是, 项目迅速又推出了新的Grid功能, 它会将连续的9张关键帧拼接成一张图片, 使模型能够一次性读取一段连续的画面序列, 可不是零散的静态截图, 如此一来还有一个额外的好处, 先前提到的26张关键帧, 能够进一步被压缩成3张图, Token消耗又降低了一截。

Chat GPT真的能看懂视频?开源项目让AI看视频真相揭秘-第7张图片-世界杯直播平台-世界杯2026直播平台-免费观看官方-V3.6.9

第五个亮点:不只是总结视频,而是带着目标去分析

以0.3.0的版本而言, 增添了一个全新的参数why, 能够于命令行当中直接向工具表明‘你为什么要看这段视频’, 例如:

crv "https://youtu.be/..." --why "find the pricing strategy" --kb ~/notes

与所提及的事物相配套的, 还有一个 kb 参数, 它能够将分析得出的结果, 保存放置于你自身的知识库, 也就是 notes 文件夹当中, 并且会依据日期进行命名这样一来,结果便不会因为 crv - out 目录被清理而就此消失不见。

免费版之外,还有一个付费的 crv Pro

还有一点, claude-real-video开源免费的这一部分, 所进行的工作是"让模型能够看到视频", 这也正是之前所提到的场景抽帧, 还有经过去重处理, 之后要进行拼图操作, 最后还要完成时间轴对齐。项目主页还在推广一款需一次性付费(19 美元)的 crv Pro, 其主打“使模型能够看懂视频”, 像识别镜头运镜的方式(固定机位、摇镜、推拉、手持), 统计剪辑的节奏, 生成一份画面之外的“感知时间轴”, 记录那些仅靠看画面无法推断出来的信息, 像手势、表情、语气变化、情绪、非语音的声音事件, 还要配上一份面向短视频创作者的分析报告等。

Chat GPT真的能看懂视频?开源项目让AI看视频真相揭秘-第8张图片-世界杯直播平台-世界杯2026直播平台-免费观看官方-V3.6.9

网友:应该去掉项目名字里的Claude!

对于这个开源工具世界杯直播观看,网友的评论大多分两种。

一种是赞同项目的思路:

“这看起来很酷开云app在线入口,开云真人官方下载,但是应该去掉名字里的Claude。”

“我认为这比单纯的 LLM 相关应用更有用。”

也有网友对这个项目的一些技术方面提出疑问:

我有着使用ffmpeg场景检测方面的经验, 这个经验表明它是很不稳定的了。它存在着有时有效的情况, 然而却绝不是可靠的样子。

Chat GPT真的能看懂视频?开源项目让AI看视频真相揭秘-第9张图片-世界杯直播平台-世界杯2026直播平台-免费观看官方-V3.6.9

写在最后

过去,我们总希望等待模型原生支持更长的视频输入。

而这个项目提供了另一种路线:不是升级模型,而是升级上下文。

模型所接收到的信息, 被预先组织成了最为适宜理解的形式, 往后, 不管是视频, 还是网页, 亦或是代码仓库, 甚至是长文档, 我们或许都无需等待模型“原生支持”。

要是能够将信息整理成模型极为易于理解的上下文, 一样能够取得近乎原生能力的成效。

标签: AI视频分析 开源项目 场景检测 关键帧提取 上下文理解

发布评论 0条评论)

还木有评论哦,快来抢沙发吧~