🎙️ 专属智能体 · Hermes on Windows
音视频转录 Agent
给你一个链接或一段文字,我把它变成可用的成品:带标点分段的中文稿件、固定音色的配音、校验过的字幕,以及内容库笔记。
⚠️ 本页为只读演示,不连接任何真实服务,无法被他人调用
模拟对话 · 试试输入指令(仅演示)
转写 B 站视频
配音
转字幕
小红书入库
核心能力CAPABILITIES
四类任务,全部本地化处理,内容不上传云端
📝
音视频 → 文稿
B站/YouTube 链接或本地文件,按语言自动选模型转录,错别字校正 + 标点 + 分段,输出 A5 格式 docx。
zh(1.00) · 554.7s · 312s 完成
🎙️
口播稿 → 配音
VoxCPM2 固定音色「温暖女生-童书绘本配音」,短段生成 + 克隆音色,逐段质检 ≥90%,语速可调。
156.7s wav · 48kHz · 15 段拼接
💬
音频 → 字幕
按语言断点标记 + DP 最优分行(中文 10/12 字、英文 14/18 字符),校验 0 错误后才交付。
srt_validate.py · 14 条 · 0 问题
📚
小红书/内容入库
对标笔记抓取 → 元信息/图片/转写正文 → Obsidian 内容库,英文内容自动附中文翻译。
37 条笔记 + 2 条 B站英文入库
执行流程WORKFLOW
多步任务先列计划 → 确认 → 执行 → 校验 → 汇报;发送前必须用户明确指令
1 获取内容
→
2 按语言选模型
→
3 转写
→
4 校对(有稿以稿为准)
→
5 配音/字幕
→
6 校验
→
7 交付
→
8 汇报
模型优先级:中文 → moss | 英文 → parakeet | 日文 → ja-sherpa | 兜底 faster-whisper GPU
能力边界BOUNDARIES
能做什么、不能做什么,一目了然
✅ 能做
音视频转文稿(中文/英文/日文)
口播稿配音(固定音色、可克隆)
音频/视频转 SRT 字幕(带校验)
小红书对标内容抓取入库
转录文稿输出 A5 docx
❌ 不做/不能
画分镜/封面(由 AI分镜师 负责)
跨平台数据(邮箱/网盘/其他账号)
未经授权的真人身份发言
纯音乐无语音内容(标注跳过)
不主动外发任何内容(等指令)
真实产出示例REAL OUTPUTS
均为实际运行结果(2026-08)
① 转文稿 达人种草带不动货?少了这一步闭环全白费(9:15)→ 12 段带标点 docx
② 配音 小猫怎么能轻松跳上它身高四五倍的柜子 → 156.7s wav(15 段克隆拼接)
③ 字幕 00:01:24,530 --> 00:01:37,970 这一下子有多快呢?你眨一下眼睛的时间大概是三百分之一秒……
④ 入库 02_内容素材\只有4个脑袋,才能成为AI时代的大赢家_BV1s37P6AE5d\笔记信息.md(英文转写 + 中文翻译)