全部Web服务

Okou上的视频理解

不用看视频,直接读:先拿到带时间戳的文字稿,再挑出那几帧真正值得看的画面。目前免费。

运行时 · 无需配置 · 仅记录用量统计,目前0积分

智能体没法看完一小时的视频,你在午饭前也看不完。所以它改成读:先拿到带时间戳的对话文字,这本身就是整段内容的索引,再从那两三个必须用眼睛看的时刻抓出截图。

它支持视频链接、在对话里分享的文件,也支持磁盘上的文件,而且目前调用不花钱。这样一来,只要有人带着问题丢过来一段录像,从这里入手就是合理的第一步。

视频理解是什么

录像堆积的速度永远快过有人去看的速度:演示、操作讲解、访谈、会议,还有当时觉得重要就顺手录下来的各种场次。

处理一段录像,高效的办法不是把它看完,而是读文字稿,按时间戳找到关键时刻,只看那几处。这是一个两步的套路,两步在这里都有。

转写会返回带时间区间的对话文字,这同时也是一份目录。抽帧接收一组时间戳并返回画面,当答案在屏幕上而不在声音里时,你要的就是它。

因为目前调用不花钱,没必要挑着读哪些录像。一个把所有录像都建索引的工作流,和一个一条都不建的工作流,成本是一样的。

视频理解能做什么

智能体能用它做什么,做完又会拿回什么。

你要给它什么一个视频链接、在对话里分享的文件,或磁盘上的文件
文字稿对话文字,每一行都带时间区间
关键帧你指定任意时间戳,返回对应截图
用法套路先读文字稿,再只看关键的那几个时刻
纯文本选项要把内容写进正文时,可以要不带时间戳的文字稿

覆盖范围与限制

把它做不到的事先说清楚,免得有人围着能力范围之外的东西去设计工作流。

给的是文字和画面,不是理解

它把文字稿和关键帧交给智能体。至于发生了什么,是智能体自己读出来的判断,这通常比两样都没有就写出的总结更靠谱。

文字稿来自声音

一段没有声音的屏幕录像,转写不出任何可读的东西。这种情况只能按间隔抽帧,时间戳也得从文字以外的地方来。

录像越长,文字稿越长

一小时的讲话一次性丢给模型,文本量太大。分段处理比一次要完整结果更可靠。

它只转写,不区分说话人

你拿到的是说了什么、什么时候说的。谁说的要从文字稿的上下文里推断,服务本身不提供,所以需要区分说话人的工作流要写明这一点,并自行核对。

视频理解怎么收费

Web服务按调用次数扣积分,不按token计费。也没有另一份厂商账单要对。

计费仅记录用量统计,目前0积分
命令zero video

调用会被记录下来供你查看,目前消耗0积分,以合理使用为前提。抽帧在运行智能体的机器上完成,除了耗时之外不产生费用。底下没有额外的转写套餐,也没有按分钟计价需要盯着。

设置与接入

无需设置

不需要连接任何东西。没有转写服务账号,没有密钥,也没有套餐。把一段录像的链接给智能体,它第一次运行就能读。

谁可以用

读取交给智能体的录像,本来就属于它处理手头文件的一部分,所以这里没有单独的权限要授。真正的边界在于你让它访问什么。

团队都用视频理解做什么

把录像变成笔记

一场演示、一次访谈或一节课程,变成一份带时间戳的总结,外加三张说明问题的截图,趁会议记忆还新鲜时就出来了。

在长录像里找到那一刻

有人说答案就在里面某处。文字稿几秒钟就定位到,一张截图确认无误,不用谁拖着进度条来回找。

让视频可以被搜索

录像一到就转写,并把文字保留下来。原本没法搜索的素材库,变成智能体能据此回答问题的库。

什么时候不该用视频理解

要描述一段无声录像时别用它,那种情况真正的做法是按间隔抽帧,文字稿是空的。需要正式记录时别用它,自动转写是工作底稿,不是会议纪要。问题只涉及其中一段时,也别一次性转写整整一小时。

别处怎么称呼它

同一件事在市场上有好几种叫法。如果你比较过其中某一类产品,这里说明它对应到这边的什么能力。

视频转文字API

把录像里的讲话变成程序能用的文字。这就是这里的前半部分,不需要你自己的账号或密钥。

语音转文字

底层那一步的通用叫法。在这里它会带着时间区间返回,所以不只是能读,还能用来定位。

视频转文本

手里有一段录像、需要一份能读、能引用、能搜索的文字时,人们会搜这个词。

抽帧

在指定的时间戳上取出截图。这是大家常常忘了要的一步,而当答案在屏幕上时,正是它让文字稿真正可用。

从录像生成会议笔记

由这两半拼起来的常见工作流:文字稿记下说了什么,关键帧留下展示了什么,最后由智能体写成稿子。

视频理解横向对比

视频理解对比专门的转写服务

转写服务给你一个界面、一个编辑器和一份存档,按分钟收费。这里是在工作流内部把文字和关键帧交给智能体,目前不收费。

视频理解对比会议记录工具

会议记录工具会加入通话,把笔记当成产品交付。这里处理的是你手上已有的任何录像,包括那些当初没人打算好好录的。

视频理解对比直接让模型看视频

把整段录像丢过去又慢又贵。先读文字稿再看三张截图,花很小一部分力气就能得到同样的答案。

一句话总结

让一段录像变得可用,成本最低的路径:先用文字稿当索引,再用关键帧看那些必须用眼睛确认的时刻。目前免费,也就没有理由不把每一段到手的录像都读一遍。

常见问题

转写要多少钱?

调用会被记录,目前消耗0积分,以合理使用为前提。抽帧在本地完成,除了耗时之外不花钱。

视频可以从哪里来?

一个链接、在对话里分享的文件,或者运行智能体那台机器上的文件。

会带时间戳吗?

会,默认每行一个时间区间,文字稿因此可以当索引用。要把内容写进正文时,可以要纯文本。

它能告诉我谁在说话吗?

不能。你拿到的是说了什么、什么时候说的。谁说的要从上下文推断,依赖这一点的工作流应该核对,而不是假定。

无声的屏幕录像能读吗?

没有可转写的内容,所以做法改成按间隔抽帧,时间戳由你选定,而不是从文字里找。

视频最长能处理多久?

长视频也能处理,但一小时的讲话一次性推理,文本量太大。分段处理是更可靠的做法。

它支持哪些语言?

底层模型支持的常见语言都可以。遇到冷门语言,建议先转写一小段样本,再决定要不要在上面搭东西。

我能直接要总结,而不是文字稿吗?

直接提就行。服务返回的是文字稿和关键帧,总结由读过它们的智能体来写,所以它能指出内容出自哪个时间点。

怎么让智能体用视频理解

你用日常语言说清楚要什么,智能体自己判断该用哪个服务,再去发起调用。

从录像整理笔记

把这场录像转写出来,按时间戳总结做出的决定,并抓取那三个值得截图的时刻。

找到那个片段

这通一小时的电话里有一段在谈定价。找出来,把原话引给我,再告诉我当时屏幕上是什么。

让素材库能搜索

把这个文件夹里的所有录像都转写一遍,告诉我哪些提到了新手引导。