FunASR Paraformer 时间戳:5分钟拿到每个字的毫秒级位置 FunASR Paraformer 时间戳5分钟拿到每个字的毫秒级位置【免费下载链接】FunASROpen-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.项目地址: https://gitcode.com/GitHub_Trending/fun/FunASRFunASR 的 Paraformer 时间戳功能让语音识别结果自带逐字毫秒级位置。看完这篇你能用不到 10 行代码把音频里每个字钉在时间轴上直接喂给字幕生成或关键词定位。字幕生成时你得知道这个字在第几秒做字幕、会议转录、语音搜索都绕不开同一个问题识别出今天天气真好只是第一步你还得知道今天出现在 0.12s、真好出现在 0.92s。几十分钟的录音手动标时间根本干不完。Paraformer 时间戳功能就是解决这个的——每个字对应一对[start_ms, end_ms]直接给。先看看输出长什么样跑通之后generate()返回的结果大致如下text: 今天天气真好 timestamp: [[120, 380], [380, 650], [650, 920], [920, 1180]]四个时间对对应四个汉字。单位是毫秒。如果同时开了句子级时间戳还会多一个sentence_info字段按句切分并附带每句的起止时间。三行代码跑通 Paraformer 时间戳初始化 Paraformer 模型并调用generate()关键参数在注释里标了为什么需要它from funasr import AutoModel model AutoModel(modelparaformer-zh, vad_modelfsmn-vad, punc_modelct-punc) result model.generate( inputaudio.wav, output_timestampTrue, # 没有它timestamp 字段不会出现 sentence_timestampTrue, # 输出句子级时间戳写入 sentence_info return_time_stampsTrue, # 启用时间戳后处理与对齐 ) print(result[0][text]) print(result[0][timestamp])paraformer-zh是 ModelScope 上的短名等价于speech_paraformer-large-vad-punc_asr_nat-zh-cn-16k-common-vocab8404-pytorch。fsmn-vad负责长音频切段ct-punc负责标点恢复三者配合就是生产级中文 ASR 链路。返回字段逐个拆解字段含义示例text识别文本含标点今天天气真好。timestamp逐字时间戳单位 ms[[120,380],[380,650]]sentence_info句子级切分需sentence_timestampTrue[{text, start, end, timestamp}]raw_text未加标点的原始文本需return_raw_textTrue今天天气真好踩过的坑一个个说结果里没有timestamp字段原因output_timestamp是generate()的运行参数不是AutoModel的初始化参数。解法每次调用generate()时显式传output_timestampTrue。时间戳和文字对不上、错位原因Paraformer 按 16kHz 单声道设计44.1kHz 的 MP3 直接塞进去时间轴会漂。解法先ffmpeg -i in.mp3 -ar 16000 -ac 1 out.wav转格式再喂给模型。长音频后段的时间戳乱了原因VAD 切段后每段的时间戳是段内相对值。解法fsmn-vad会自动做偏移补偿如果你自己切段记得手动加上段起始偏移。想要句子级而不是字级时间戳原因默认timestamp是逐字的字幕场景通常按句。解法加sentence_timestampTrue然后读sentence_info字段每句自带start、end和该句所有字的时间戳。下一步接字幕生成仓库里有现成脚本 generate_subtitle.py把timestamp直接转成 SRT / VTT 格式支持说话人标注。长音频调优vad_kwargs{max_single_segment_time: 30000}控制 VAD 最大分段时长毫秒避免单段过长导致时间戳累积漂移。模型源码在 funasr/models/paraformer/时间戳对齐逻辑在model.py里可以看到。【免费下载链接】FunASROpen-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.项目地址: https://gitcode.com/GitHub_Trending/fun/FunASR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考