🎙️ 专属智能体 · Hermes on Windows

音视频转录 Agent

给你一个链接或一段文字,我把它变成可用的成品:带标点分段的中文稿件、固定音色的配音、校验过的字幕,以及内容库笔记。

⚠️ 本页为只读演示,不连接任何真实服务,无法被他人调用
模拟对话 · 试试输入指令(仅演示)
转写 B 站视频 配音 转字幕 小红书入库

核心能力CAPABILITIES

四类任务,全部本地化处理,内容不上传云端

📝

音视频 → 文稿

B站/YouTube 链接或本地文件,按语言自动选模型转录,错别字校正 + 标点 + 分段,输出 A5 格式 docx。

zh(1.00) · 554.7s · 312s 完成
🎙️

口播稿 → 配音

VoxCPM2 固定音色「温暖女生-童书绘本配音」,短段生成 + 克隆音色,逐段质检 ≥90%,语速可调。

156.7s wav · 48kHz · 15 段拼接
💬

音频 → 字幕

按语言断点标记 + DP 最优分行(中文 10/12 字、英文 14/18 字符),校验 0 错误后才交付。

srt_validate.py · 14 条 · 0 问题
📚

小红书/内容入库

对标笔记抓取 → 元信息/图片/转写正文 → Obsidian 内容库,英文内容自动附中文翻译。

37 条笔记 + 2 条 B站英文入库

执行流程WORKFLOW

多步任务先列计划 → 确认 → 执行 → 校验 → 汇报;发送前必须用户明确指令

1 获取内容
2 按语言选模型
3 转写
4 校对(有稿以稿为准)
5 配音/字幕
6 校验
7 交付
8 汇报

模型优先级:中文 → moss | 英文 → parakeet | 日文 → ja-sherpa | 兜底 faster-whisper GPU

能力边界BOUNDARIES

能做什么、不能做什么,一目了然

✅ 能做

  • 音视频转文稿(中文/英文/日文)
  • 口播稿配音(固定音色、可克隆)
  • 音频/视频转 SRT 字幕(带校验)
  • 小红书对标内容抓取入库
  • 转录文稿输出 A5 docx
  • ❌ 不做/不能

  • 画分镜/封面(由 AI分镜师 负责)
  • 跨平台数据(邮箱/网盘/其他账号)
  • 未经授权的真人身份发言
  • 纯音乐无语音内容(标注跳过)
  • 不主动外发任何内容(等指令)
  • 真实产出示例REAL OUTPUTS

    均为实际运行结果(2026-08)

    ① 转文稿 达人种草带不动货?少了这一步闭环全白费(9:15)→ 12 段带标点 docx
    ② 配音 小猫怎么能轻松跳上它身高四五倍的柜子 → 156.7s wav(15 段克隆拼接)
    ③ 字幕 00:01:24,530 --> 00:01:37,970 这一下子有多快呢?你眨一下眼睛的时间大概是三百分之一秒……
    ④ 入库 02_内容素材\只有4个脑袋,才能成为AI时代的大赢家_BV1s37P6AE5d\笔记信息.md(英文转写 + 中文翻译)