全部Web服务

Okou上的语音与配音

把写好的文字变成音频文件,音色你选,语气你说了算。不用自己的文字转语音账号。

生成 · 无需配置 · 每次成功调用按托管积分计费

把文字给它,它给你音频。选一个音色,再说说这句话该怎么落地:从容不迫,还是干脆明亮,用你跟人说话时的那种大白话就行。

音频回来时是一个文件,智能体可以马上用:放进视频里、附在消息上,或者发布到页面上。账号由Okou持有,按你实际拿到的音频量计费,所以你名下不会多出一个语音平台的套餐。

语音与配音是什么

多数团队需要一条语音轨的时候,离需要一套语音策略还早得很。演示要旁白,报告在通勤路上听更合适,视频得先有人念一遍才好剪。

这就是把那一步变成一次调用。文字进去,音频文件出来,用你选的音色;默认的读法不是你要的,就再加一句关于语气的说明。

因为它按音频时长而不是按请求次数计价,读一段话的工作流就只花一段话的钱。这才让旁白成了可以顺手加进定时任务的事,而不是单独立项。

人们平时说的文字转语音API或者AI配音工具,指的就是这件事。区别在于账号放在谁那儿,以及调用它的通常是一个正在收尾的智能体,而不是一个手动导出文件的人。

语音与配音能做什么

智能体能用它做什么,做完又会拿回什么。

你给什么要念的文字,支持的语言都可以
拿到什么一个音频文件,附一个链接,智能体可以直接拿去用
音色一组有名字的音色供你挑
语气一句大白话,说清语调和语速
常见用途视频旁白、书面内容的音频版、语音提醒

覆盖范围与限制

把它做不到的事先说清楚,免得有人围着能力范围之外的东西去设计工作流。

只有现成音色,不做克隆

你从服务提供的音色里挑。复刻某个具体的人的声音是另一种产品,涉及另一套授权问题,应该在那个人同意的前提下,走服务商连接器,而不是放在这里。

一次只念一段

每次调用是一个音色念一段文字。两个人的对话是好几次调用加一次剪辑,值得在写稿之前先想清楚。

语气是请求,不是控制项

一句关于语调的说明确实会改变念法,但它不是一条打好标记的时间轴。任何必须踩准节拍的地方,在剪辑里修比用文字描述更省事。

你写什么它念什么

数字、缩写和人名,模型觉得该怎么念就怎么念。碰上要紧的地方,直接在文字里写全,比跟语气说明较劲快得多。

语音与配音怎么收费

Web服务按调用次数扣积分,不按token计费。也没有另一份厂商账单要对。

计费每次成功调用按托管积分计费
运行在OpenAI
命令zero generate voice

按回来的音频时长扣积分,大致相当于一分钟语音19积分。一句短旁白几乎不花什么钱,一小时音频则是值得专门决定一下的事。底下没有订阅,也没有起步门槛。

产品名称和标识归各自所有者所有,出现在这里只是为了说明某项服务基于什么运行,不代表任何背书或合作关系。

设置与接入

无需设置

不用连接任何东西。不需要文字转语音的账号、密钥或套餐。如果你要的是某个特定的克隆音色或者一整套录音棚级功能,Okou也提供跑在你自己账号上的语音平台连接器。

谁可以用

产出音频文件是一项权限,按智能体、按人逐个授予;它和其他生成文件用的是同一项权限,所以一个能说话的智能体同样能画图。

团队都用语音与配音做什么

给智能体刚做完的东西配旁白

一段视频、一次操作讲解、一份周报。智能体写稿并念出来,事情就算做完了,不用再等某个拿着话筒的人。

把书面内容变成音频版

一份简报、一份报告、一组更新说明。那些从不打开文档的人会在路上听完,而每读一遍只花几个积分。

语音提醒和播报

那些需要被听见而不是被读到的短句,用到的时候现生成,不必为每种情况提前录一遍。

什么时候不该用语音与配音

如果这个声音必须是某个特定的人的,就别用它,那首先是授权问题,其次才是技术问题。要反复重剪的长音频也别用,每次重新生成整个文件太浪费。还有,当一个人念得再差也胜过它的时候,别用它;通常只要重点在于「这话是某个人说的」,就属于这种情况。

别处怎么称呼它

同一件事在市场上有好几种叫法。如果你比较过其中某一类产品,这里说明它对应到这边的什么能力。

文字转语音API

文字进,音频出,通过程序可以调用的接口完成。说的正是这件事,只是账号和密钥在我们这边。

AI配音

视频或演示的旁白,由稿子生成而不是录出来。团队找上这项服务,多半就是为了它。

不用API密钥的TTS

当模型不是问题、账号才是问题时,人们就会这样搜。这里不用注册,也没有什么要粘进环境变量里。

文章转音频

把写出来的东西变成能听的。按音频时长计价,所以花费随你实际发布的量走。

声音克隆

另一回事,这里有意不提供。请在声音主人同意的前提下,用跑在你自己账号上的语音平台连接器。

语音与配音横向对比

语音与配音对比自己开一个文字转语音账号

思路一样,配置少得多。没有密钥要保管,没有套餐要挑,访问靠的是权限而不是一个共享的密钥。

语音与配音对比语音平台连接器

连接器跑在你自己的账号上,能用到那个平台的全部能力,包括克隆音色和录音棚级的控制。这里是快车道,适合那种「有就行」的旁白。

语音与配音对比自己录

只要重点是「这话是某个人说的」,人念出来仍然更好。但如果一句话因为数字变了每周都得重做一遍,录音就是用错了工具。

一句话总结

给智能体已经做好的东西配上声音,这是最快的一条路。只用现成音色,按分钟计价,什么都不用注册。

常见问题

我需要OpenAI账号吗?

不需要。调用由Okou发起,音频按积分计费。工作流里不会出现你的密钥。

可以选音色吗?

可以,从服务提供的音色里挑,同时还能用大白话描述你想要的语气。

能克隆我的声音吗?

不能。克隆音色是有意不放进这项服务的。请在当事人同意的前提下,用跑在你自己账号上的语音平台连接器。

要花多少钱?

按音频时长扣积分,一分钟语音大约19积分。短句几乎不花什么钱。

支持哪些语言?

模型能念好几种语言。如果要求听起来像母语者,最好先听一段样音,再决定要不要把工作流押在上面。

能用在播客或视频里吗?

可以。产出的就是普通音频文件,和别的音轨一样放进剪辑里就行。

能做两个人对话吗?

一次调用做不了。分别生成每一段再拼起来,这样停顿也更好把握。

怎么让某个人名念对?

在你发送的文字里按发音拼出来。这比在语气说明里描述读法更快,也更稳。

怎么让智能体用语音与配音

你用日常语言说清楚要什么,智能体自己判断该用哪个服务,再去发起调用。

给片子配旁白

给这段演示视频写一份二十秒的稿子,用从容不迫的声音念出来。

把报告听完

把本周的总结变成音频,我路上听,控制在四分钟以内。

一句话,念好

用坚定、平实的声音念这条警告信息,把文件给我。