全部Web服務

Okou上的影片理解

不用看影片,直接讀:先拿到帶時間戳的文字稿,再挑出那幾幀真正值得看的畫面。目前免費。

執行時 · 無需配置 · 僅記錄用量統計,目前0積分

智能體沒法看完一小時的影片,你在午飯前也看不完。所以它改成讀:先拿到帶時間戳的對話文字,這本身就是整段內容的索引,再從那兩三個必須用眼睛看的時刻抓出截圖。

它支援影片連結、在對話裡分享的檔案,也支援磁碟上的檔案,而且目前呼叫不花錢。這樣一來,只要有人帶著問題丟過來一段錄影,從這裡入手就是合理的第一步。

影片理解是什麼

錄影堆積的速度永遠快過有人去看的速度:演示、操作講解、訪談、會議,還有當時覺得重要就順手錄下來的各種場次。

處理一段錄影,高效的辦法不是把它看完,而是讀文字稿,按時間戳找到關鍵時刻,只看那幾處。這是一個兩步的套路,兩步在這裡都有。

轉寫會返回帶時間區間的對話文字,這同時也是一份目錄。抽幀接收一組時間戳並返回畫面,當答案在螢幕上而不在聲音裡時,你要的就是它。

因為目前呼叫不花錢,沒必要挑著讀哪些錄影。一個把所有錄影都建索引的工作流,和一個一條都不建的工作流,成本是一樣的。

影片理解能做什麼

智能體能用它做什麼,做完又會拿回什麼。

你要給它什麼一個影片連結、在對話裡分享的檔案,或磁碟上的檔案
文字稿對話文字,每一行都帶時間區間
關鍵幀你指定任意時間戳,返回對應截圖
用法套路先讀文字稿,再只看關鍵的那幾個時刻
純文字選項要把內容寫進正文時,可以要不帶時間戳的文字稿

覆蓋範圍與限制

把它做不到的事先說清楚,免得有人圍著能力範圍之外的東西去設計工作流。

給的是文字和畫面,不是理解

它把文字稿和關鍵幀交給智能體。至於發生了什麼,是智能體自己讀出來的判斷,這通常比兩樣都沒有就寫出的總結更靠譜。

文字稿來自聲音

一段沒有聲音的螢幕錄影,轉寫不出任何可讀的東西。這種情況只能按間隔抽幀,時間戳也得從文字以外的地方來。

錄影越長,文字稿越長

一小時的講話一次性丟給模型,文字量太大。分段處理比一次要完整結果更可靠。

它只轉寫,不區分說話人

你拿到的是說了什麼、什麼時候說的。誰說的要從文字稿的上下文裡推斷,服務本身不提供,所以需要區分說話人的工作流要寫明這一點,並自行核對。

影片理解怎麼收費

Web服務按呼叫次數扣積分,不按token計費。也沒有另一份廠商帳單要對。

計費僅記錄用量統計,目前0積分
命令zero video

呼叫會被記錄下來供你檢視,目前消耗0積分,以合理使用為前提。抽幀在執行智能體的機器上完成,除了耗時之外不產生費用。底下沒有額外的轉寫套餐,也沒有按分鐘計價需要盯著。

設定與接入

無需設定

不需要連線任何東西。沒有轉寫服務帳號,沒有金鑰,也沒有套餐。把一段錄影的連結給智能體,它第一次執行就能讀。

誰可以用

讀取交給智能體的錄影,本來就屬於它處理手標頭檔案的一部分,所以這裡沒有單獨的權限要授。真正的邊界在於你讓它訪問什麼。

團隊都用影片理解做什麼

把錄影變成筆記

一場演示、一次訪談或一節課程,變成一份帶時間戳的總結,外加三張說明問題的截圖,趁會議記憶還新鮮時就出來了。

在長錄影裡找到那一刻

有人說答案就在裡面某處。文字稿幾秒鐘就定位到,一張截圖確認無誤,不用誰拖著進度條來回找。

讓影片可以被搜尋

錄影一到就轉寫,並把文字保留下來。原本沒法搜尋的素材庫,變成智能體能據此回答問題的庫。

什麼時候不該用影片理解

要描述一段無聲錄影時別用它,那種情況真正的做法是按間隔抽幀,文字稿是空的。需要正式記錄時別用它,自動轉寫是工作底稿,不是會議紀要。問題只涉及其中一段時,也別一次性轉寫整整一小時。

別處怎麼稱呼它

同一件事在市場上有好幾種叫法。如果你比較過其中某一類產品,這裡說明它對應到這邊的什麼能力。

影片轉文字API

把錄影裡的講話變成程式能用的文字。這就是這裡的前半部分,不需要你自己的帳號或金鑰。

語音轉文字

底層那一步的通用叫法。在這裡它會帶著時間區間返回,所以不只是能讀,還能用來定位。

影片轉文字

手裡有一段錄影、需要一份能讀、能引用、能搜尋的文字時,人們會搜這個詞。

抽幀

在指定的時間戳上取出截圖。這是大家常常忘了要的一步,而當答案在螢幕上時,正是它讓文字稿真正可用。

從錄影生成會議筆記

由這兩半拼起來的常見工作流:文字稿記下說了什麼,關鍵幀留下展示了什麼,最後由智能體寫成稿子。

影片理解橫向對比

影片理解對比專門的轉寫服務

轉寫服務給你一個介面、一個編輯器和一份存檔,按分鐘收費。這裡是在工作流內部把文字和關鍵幀交給智能體,目前不收費。

影片理解對比會議記錄工具

會議記錄工具會加入通話,把筆記當成產品交付。這裡處理的是你手上已有的任何錄影,包括那些當初沒人打算好好錄的。

影片理解對比直接讓模型看影片

把整段錄影丟過去又慢又貴。先讀文字稿再看三張截圖,花很小一部分力氣就能得到同樣的答案。

一句話總結

讓一段錄影變得可用,成本最低的路徑:先用文字稿當索引,再用關鍵幀看那些必須用眼睛確認的時刻。目前免費,也就沒有理由不把每一段到手的錄影都讀一遍。

常見問題

轉寫要多少錢?

呼叫會被記錄,目前消耗0積分,以合理使用為前提。抽幀在本地完成,除了耗時之外不花錢。

影片可以從哪裡來?

一個連結、在對話裡分享的檔案,或者執行智能體那臺機器上的檔案。

會帶時間戳嗎?

會,預設每行一個時間區間,文字稿因此可以當索引用。要把內容寫進正文時,可以要純文字。

它能告訴我誰在說話嗎?

不能。你拿到的是說了什麼、什麼時候說的。誰說的要從上下文推斷,依賴這一點的工作流應該核對,而不是假定。

無聲的螢幕錄影能讀嗎?

沒有可轉寫的內容,所以做法改成按間隔抽幀,時間戳由你選定,而不是從文字裡找。

影片最長能處理多久?

長影片也能處理,但一小時的講話一次性推理,文字量太大。分段處理是更可靠的做法。

它支援哪些語言?

底層模型支援的常見語言都可以。遇到冷門語言,建議先轉寫一小段樣本,再決定要不要在上面搭東西。

我能直接要總結,而不是文字稿嗎?

直接提就行。服務返回的是文字稿和關鍵幀,總結由讀過它們的智能體來寫,所以它能指出內容出自哪個時間點。

怎麼讓智能體用影片理解

你用日常語言說清楚要什麼,智能體自己判斷該用哪個服務,再去發起呼叫。

從錄影整理筆記

把這場錄影轉寫出來,按時間戳總結做出的決定,並抓取那三個值得截圖的時刻。

找到那個片段

這通一小時的電話裡有一段在談定價。找出來,把原話引給我,再告訴我當時螢幕上是什麼。

讓素材庫能搜尋

把這個資料夾裡的所有錄影都轉寫一遍,告訴我哪些提到了新手引導。