音视频处理

音视频处理

音视频处理 类动作。

提取音频

extract_audio

音视频处理

用途:从音频或视频文件提取可识别音频,统一输出为 wav。适合给语音识别或字幕生成继续使用。

写法:提取音频 媒体路径=<媒体路径> [输出音频路径=<输出音频路径>] [采样率=<采样率>] [声道数=<声道数>] [覆盖已有文件=<覆盖已有文件>]

保存为

默认保存主结果,通常就是 音频路径 这个字段。

正确示例

提取音频 媒体路径='D:/素材/视频.mp4' 输出音频路径='D:/素材/视频_识别.wav'

# 说明:从视频提取单声道 16k wav 音频。

错误示例

提取音频 输出音频路径="D:/demo.mp3"

为什么错:漏写了必填参数:媒体路径。

展开查看参数和注意事项
中文参数英文参数用途必填默认值
媒体路径media_path输入媒体文件路径;支持视频文件和音频文件。
输出音频路径output_audio_path输出 wav 音频路径;不填时默认生成到原文件同目录。
采样率sample_rate_hz输出采样率,默认 16000。16000
声道数channel_count输出声道数,默认 1。1
覆盖已有文件overwrite输出文件已存在时是否覆盖;1 覆盖,0 不覆盖。1

返回结果

如果你要整份返回对象,而不只是主结果,可在行尾写 返回结果=变量名

返回结果

保存后通常可按字段路径继续读取。

字段路径类型必有说明
音频路径string未提供说明
音频格式string未提供说明
采样率integer未提供说明
声道数integer未提供说明
文件大小integer未提供说明

返回/保存方式:普通动作需要留给后续步骤时,通常可在行尾追加 保存为=变量名,默认保存主结果字段 音频路径。

腾讯ASR语音识别

tencent_asr_recognize

音视频处理

用途:识别本地音频/视频或音频网址,生成字幕内容,并可保存为 SRT 文件。

写法:腾讯ASR语音识别 [本地媒体文件=<本地媒体文件>] [音频网址=<音频网址>] [保存字幕文件=<保存字幕文件>] [识别模型=<识别模型>] [单句最大字数=<单句最大字数>] [音频格式=<音频格式>] [过滤脏词=<过滤脏词>] [过滤语气词=<过滤语气词>] [过滤标点=<过滤标点>] [数字转换模式=<数字转换模式>] [说话人分离=<说话人分离>] [说话人数=<说话人数>] [轮询间隔秒数=<轮询间隔秒数>] [最长等待秒数=<最长等待秒数>]

保存为

默认保存主结果,通常就是 识别文本 这个字段。

正确示例

腾讯ASR语音识别 音频网址='https://example.com/audio.mp3' 音频格式='mp3' 保存字幕文件='D:/输出/字幕' 单句最大字数=15 返回结果=识别结果

# 说明:识别网址音频,生成并保存 SRT,同时保留逐句和逐词结果。

错误示例

腾讯ASR语音识别 本地媒体文件="示例值" 音频网址="D:/demo.mp3"

为什么错:这两个参数不能同时填写:本地媒体文件、音频网址。

展开查看参数和注意事项
中文参数英文参数用途必填默认值
本地媒体文件media_path本地音频或视频文件路径;会自动提取 16kHz 单声道音频后识别。
音频网址audio_url腾讯云可访问到的音频 URL。真正的长录音建议优先走这个参数。
保存字幕文件output_file_path可选;把生成的字幕内容保存为 SRT 文件,自动补 .srt 后缀,目标已存在时直接覆盖。
识别模型engine_model_type腾讯云识别引擎模型,默认 16k_zh;常见可选值如 8k_zh、16k_en、16k_yue。16k_zh
单句最大字数single_sentence_max_length单句最大字数,默认 15;填 0 关闭,其他值会归一化到腾讯实际支持范围。15
音频格式voice_format音频格式;本地文件不填时按扩展名自动判断。使用 音频URL 时必须显式填写。
过滤脏词filter_dirty是否过滤脏词;0 不过滤,1 过滤。0
过滤语气词filter_modal是否过滤语气词;0 不过滤,1 过滤。0
过滤标点filter_punc是否过滤标点;0 保留,1 过滤。0
数字转换模式convert_num_mode数字转换模式;0 保持原样,1 转成阿拉伯数字。1
说话人分离speaker_diarization是否开启说话人分离;0 关闭,1 开启。0
说话人数speaker_number说话人数;0 表示让服务自动判断。0
轮询间隔秒数poll_interval_seconds轮询任务状态的间隔秒数,默认 5 秒。5.0
最长等待秒数max_wait_seconds最长等待任务完成的秒数,默认 1800 秒。1800.0

返回结果

如果你要整份返回对象,而不只是主结果,可在行尾写 返回结果=变量名

返回结果

保存后通常可按字段路径继续读取。

字段路径类型必有说明
识别文本string未提供说明
请求IDstring未提供说明
任务IDinteger | string未提供说明
任务状态integer | string | null未提供说明
任务结果描述string | null未提供说明
音频来源string未提供说明
引擎模型string未提供说明
音频格式string未提供说明
说话人分离boolean未提供说明
结果句子列表array未提供说明
结果句子数integer未提供说明
逐词列表array未提供说明
字幕文件路径string | null未提供说明
保存字幕文件string | null未提供说明
是否写入文件boolean未提供说明
字幕条数integer未提供说明
SRT字幕条数integer未提供说明
字幕内容string未提供说明
字幕生成状态string未提供说明
字幕未生成原因string | null未提供说明
实际断句长度integer未提供说明
临时音频已清理boolean未提供说明

返回/保存方式:普通动作需要留给后续步骤时,通常可在行尾追加 保存为=变量名,默认保存主结果字段 识别文本。

识别音频有效时间线

analyze_audio_timeline

音视频处理

用途:分析音频或带音轨媒体的时间线,返回可直接复用的时间线片段列表;当前只负责 action 契约和接口接线,算法细节依赖音频时间线核心模块。

写法:识别音频有效时间线 媒体路径=<媒体路径> [预设=<预设>] [高级设置=<高级设置>]

保存为

默认保存主结果,通常就是 时间线片段列表 这个字段。

正确示例

识别音频有效时间线 媒体路径='D:/素材/配音.wav' 预设='标准' 高级设置={阈值模式='固定阈值', 噪声底='关闭', 阈值=0.35, 音轨索引=0, 边距=0.08, 平滑=0.12}

# 说明:分析指定媒体并返回时间线片段列表,可配合 保存为 继续引用结果。

错误示例

识别音频有效时间线 预设="示例值"

为什么错:漏写了必填参数:媒体路径。

展开查看参数和注意事项
中文参数英文参数用途必填默认值
媒体路径media_path要分析的本地媒体文件路径;可以是音频文件,也可以是带音轨的视频文件。
预设preset分析预设;支持 轻剪、标准、狠剪、口播、嘈杂环境。主要用于给阈值、边距、平滑提供默认值。
高级设置advanced_options可选高级设置对象,支持:阈值模式、噪声底、阈值、音轨索引、边距、平滑、强制保留片段、强制裁剪片段。

返回结果

如果你要整份返回对象,而不只是主结果,可在行尾写 返回结果=变量名

返回结果

保存后通常可按字段路径继续读取。

字段路径类型必有说明
媒体路径string未提供说明
时间线片段列表array未提供说明
时间线片段列表[*]object数组元素
时间线片段列表[*].startinteger未提供说明
时间线片段列表[*].endinteger未提供说明
片段数量integer未提供说明
最终总时长integer未提供说明
分析参数object未提供说明
分析参数.阈值number | null未提供说明
分析参数.预设string | null未提供说明
分析参数.阈值模式string | null未提供说明
分析参数.噪声底string | null未提供说明
分析参数.音轨索引string | integer | null未提供说明
分析参数.边距number | null未提供说明
分析参数.平滑number | null未提供说明
分析参数.强制保留片段array | null未提供说明
分析参数.强制裁剪片段array | null未提供说明
分析参数.实际阈值number | null未提供说明
分析参数.估算噪声底number | null未提供说明

返回/保存方式:普通动作需要留给后续步骤时,通常可在行尾追加 保存为=变量名,默认保存主结果字段 时间线片段列表。

视频镜头分割

detect_video_scenes

音视频处理

用途:检测视频镜头分割,返回可直接复用的时间线片段列表,可继续传给按时间线添加素材到轨道等时间线动作。

写法:视频镜头分割 视频路径=<视频路径> [分割阈值=<分割阈值>] [开始时间=<开始时间>] [结束时间=<结束时间>]

保存为

默认保存主结果,通常就是 时间线列表 这个字段。

正确示例

视频镜头分割 视频路径="D:/demo.mp4" 分割阈值="示例值"

错误示例

视频镜头分割 分割阈值="示例值"

为什么错:漏写了必填参数:视频路径。

展开查看参数和注意事项
中文参数英文参数用途必填默认值
视频路径video_path要做镜头分割的视频文件路径。
分割阈值thresholdPySceneDetect 的内容变化阈值,越小越敏感;默认 30。30.0
开始时间start_time只从这个时间开始检测,单位为秒,也支持 HH:MM:SS、s、ms;默认从视频开头开始。
结束时间end_time只检测到这个时间,单位为秒,也支持 HH:MM:SS、s、ms;默认检测到视频结尾。

返回结果

如果你要整份返回对象,而不只是主结果,可在行尾写 返回结果=变量名

返回结果

保存后通常可按字段路径继续读取。

字段路径类型必有说明
视频路径string未提供说明
时间线列表array未提供说明
时间线列表[*]object数组元素
时间线列表[*].startinteger未提供说明
时间线列表[*].endinteger未提供说明
时间线列表[*].开始帧integer未提供说明
时间线列表[*].结束帧integer未提供说明
时间线列表[*].帧数integer未提供说明
镜头数量integer未提供说明
分割阈值number未提供说明
开始时间number未提供说明
结束时间number | null未提供说明

返回/保存方式:普通动作需要留给后续步骤时,通常可在行尾追加 保存为=变量名,默认保存主结果字段 时间线列表。

截取视频帧

extract_video_frame

音视频处理

用途:从视频指定时间截帧保存为图片。

写法:截取视频帧 视频文件路径=<视频文件路径> 图片文件路径=<图片文件路径> 第几秒=<第几秒>

保存为

默认保存主结果,通常就是 图片路径 这个字段。

正确示例

截取视频帧 视频文件路径='D:/素材/演示.mp4' 图片文件路径='D:/素材/预览图.png' 第几秒=1.5

# 说明:截取 1.5 秒处的一帧

错误示例

截取视频帧 视频文件路径="D:/demo.mp4" 图片文件路径="D:/demo.png"

为什么错:漏写了必填参数:第几秒。

展开查看参数和注意事项
中文参数英文参数用途必填默认值
视频文件路径video_file_path要截帧的视频文件路径。
图片文件路径image_file_path保存截帧图片的路径。
第几秒seconds要截取第几秒的画面。

返回结果

如果你要整份返回对象,而不只是主结果,可在行尾写 返回结果=变量名

返回结果

保存后通常可按字段路径继续读取。

字段路径类型必有说明
图片路径string未提供说明

返回/保存方式:普通动作需要留给后续步骤时,通常可在行尾追加 保存为=变量名,默认保存主结果字段 图片路径。

生成视频宫格封面

generate_video_grid_cover

音视频处理

用途:从视频随机帧生成宫格封面。

写法:生成视频宫格封面 视频文件路径=<视频文件路径> 图片文件路径=<图片文件路径> [宫格数量=<宫格数量>]

保存为

默认保存主结果,通常就是 图片路径 这个字段。

正确示例

生成视频宫格封面 视频文件路径='D:/素材/演示.mp4' 图片文件路径='D:/素材/封面图.png' 宫格数量='4'

# 说明:生成四宫格封面

错误示例

生成视频宫格封面 视频文件路径="D:/demo.mp4"

为什么错:漏写了必填参数:图片文件路径。

展开查看参数和注意事项
中文参数英文参数用途必填默认值
视频文件路径video_file_path要抽帧的视频文件路径。
图片文件路径image_file_path生成后的宫格封面图片路径。
宫格数量grid_count支持 4、6、9、12、16。4

返回结果

如果你要整份返回对象,而不只是主结果,可在行尾写 返回结果=变量名

返回结果

保存后通常可按字段路径继续读取。

字段路径类型必有说明
图片路径string未提供说明

返回/保存方式:普通动作需要留给后续步骤时,通常可在行尾追加 保存为=变量名,默认保存主结果字段 图片路径。