音视频转录整理 Agent

把播客、视频和会议录音整理成可分享的中文提纯稿

小D是一个运行在飞书里的 Hermes Agent。用户发送公开视频、播客、飞书妙记或本地音频路径后, 它会获取音频或逐字稿,清洗转录内容,并生成结构清晰、可直接阅读的中文文稿。

模拟体验 不可调用真实 Agent
请把这个 B 站链接转录整理成分享式提纯稿:https://www.bilibili.com/video/...
收到。我会先检查链接是否公开可访问,再查找字幕;如果没有可靠文本,就用 yt-dlp 获取音频、 ffmpeg 转码、faster-whisper 转录,最后整理成中文提纯稿。
输出示例

第22集:公司群消息自动汇总与客户信息管理

已按主题分段,无时间戳、无说话人标签。无法确认的术语已标注 [待确认]。

1.5-4 小时

人工转录、校对、整理一条长音视频的常见耗时

10-30 分钟

Agent 自动处理后拿到初稿的目标耗时,长音频会更久

飞书入口

私聊直接发链接,群聊 @Bot 触发任务

Workflow

从一个链接到一篇可读文稿

小D不是简单摘要工具。它的目标是保留论述链条、案例、数字和必要原话,再把口语内容整理成文章。

01

接收输入

用户在飞书私聊或群聊 @Bot 发送链接、会议录音标识或音频路径。

02

判断授权

先确认内容是否公开可访问;私密、付费、内部材料必须暂停确认。

03

获取文本或音频

优先用现成字幕和逐字稿;没有可靠文本时再下载音频并转码。

04

转录与整理

用 faster-whisper 识别中文,再清洗、校对、重组为分享式文稿。

05

交付结果

优先创建飞书文档;失败时降级为本地 Markdown 路径。

Capabilities

它能做什么

识别 B 站、YouTube、小宇宙、飞书妙记和本地音频路径
优先查找字幕、逐字稿或会议文本
在授权范围内获取音频并转成可识别格式
使用 faster-whisper 生成中文转录稿
清洗时间戳、说话人标签和无信息重复
按真实主题整理成中文分享式提纯稿

推荐输入格式

请把这个链接转录整理成分享式提纯稿:
<音视频链接>

交付标准

无时间戳、无说话人标签,不是三句话总结,而是按真实主题分段的中文提纯稿。

Tool Stack

背后的工具栈

Hermes

运行 Agent Profile,接收飞书消息,调度任务

飞书 Bot

作为用户入口,承载私聊、群聊、文档交付

yt-dlp

在合规范围内获取公开音视频资源

ffmpeg

抽取音频、转码和检查媒体可用性

faster-whisper

中文语音识别和原始转录

Codex

搭建、配置、验证和维护 Agent

Safety Boundary

这个页面不会暴露你的真实 Agent

这是一个公开展示对象,只描述能力和使用规范。访客不能通过这里调用飞书 Bot、Hermes Profile、 你的 API、你的文档权限或任何私有数据。

不绕过登录、付费墙、平台访问控制或版权限制
不处理未经授权的私密会议、内部录音或第三方隐私材料
不发布、传播、搬运原始音视频
不保证专有名词完全正确,无法确认时标注 [待确认]
当前只做中文整理,不做多语言翻译

Public Showcase

适合用来给同学、圈友或评审展示

他们能看到小D的定位、流程、工具栈、输出标准和安全边界,但不会接触你的真实运行环境。