a sdk speech for xfyun
Project description
xfyunsdkspeech
xfyunsdkspeech是讯飞开放平台语音转写相关 API的Python SDK,提供语音听写、性别年龄识别、语音评测、语音转写、歌曲识别、实时语音转写、语音合成等功能的客户端实现。
功能特点
- 语音听写:通过音频信息识别成文字
- 性别年龄识别:通过声音信息识别用户性别年龄等信息
- 语音评测:通过智能语音技术自动对发音水平进行评价、发音错误、缺陷定位和问题分析的能力
- 歌曲识别:检测歌曲, 识别歌曲名称
- 语音转写:将音频转换成文本数据
- 实时语音转写:将连续的音频流内容,实时识别返回对应的文字流内容
- 语音合成:通过文本数据合成音频流数据
安装方法
pip install xfyunsdkspeech
依赖说明
- xfyunsdkcore>=0.1.0: 核心SDK依赖
- python-dotenv: 环境变量管理
快速开始
人脸检测示例
# 初始化客户端
client = RtasrClient(
app_id=os.getenv('APP_ID'), # 替换为你的应用ID
api_key=os.getenv('API_KEY'), # 替换为你的API密钥
)
file_path = "D:\\iflytek\\project\\cloudPlatform\\demo\\websdk-java-demo\\src\main\\resources\\audio\\rtasr.pcm"
f = open(file_path, 'rb')
for chunk in client.stream(f):
logger.info(f"返回结果: {chunk}")
更多示例见demo
核心客户端
IatClient
语音听写流式接口,用于1分钟内的即时语音转文字技术,支持实时返回识别结果,达到一边上传音频一边获得识别文本的效果
IgrClient
性别年龄识别,即机器对说话者的年龄大小以及性别属性进行分析,可以通过收到的音频数据判定发音人的性别(男,女)及年龄范围(小孩,中年,老人)
IseClient
通过智能语音技术自动对发音水平进行评价、发音错误、缺陷定位和问题分析的能力接口
LFasrClient
基于深度全序列卷积神经网络,将长段音频(5小时以内)数据转换成文本数据
QbhClient
歌曲识别技术分为歌曲原声识别以及哼唱识别。歌曲原声识别通过听筒收集音乐播放信息,生成音频指纹,在曲库中识别到对应的歌曲。 哼唱识别通过用户对着话筒哼唱小段歌曲,系统自动识别并检索出所哼唱的歌曲
RtasrClient
将连续的音频流内容,实时识别返回对应的文字流内容
TTSClient
语音合成流式接口将文字信息转化为声音信息,同时提供了众多极具特色的发音人(音库)供您选择
许可证
请参见LICENSE文件
Project details
Download files
Download the file for your platform. If you're not sure which to choose, learn more about installing packages.
Source Distribution
Built Distribution
Filter files by name, interpreter, ABI, and platform.
If you're not sure about the file name format, learn more about wheel file names.
Copy a direct link to the current filters
File details
Details for the file xfyunsdkspeech-0.0.3.tar.gz.
File metadata
- Download URL: xfyunsdkspeech-0.0.3.tar.gz
- Upload date:
- Size: 17.4 kB
- Tags: Source
- Uploaded using Trusted Publishing? No
- Uploaded via: twine/4.0.2 CPython/3.7.1
File hashes
| Algorithm | Hash digest | |
|---|---|---|
| SHA256 |
32d3075add0030b772df1190a727108f5572ce86d814787372fa5de495784e94
|
|
| MD5 |
bf9c3087c18d95d1838979dfbf841319
|
|
| BLAKE2b-256 |
e7d79f9663341fe6f49f9743f8767946d6e781cdd00e76ecae21ab8538b0bfdf
|
File details
Details for the file xfyunsdkspeech-0.0.3-py3-none-any.whl.
File metadata
- Download URL: xfyunsdkspeech-0.0.3-py3-none-any.whl
- Upload date:
- Size: 26.3 kB
- Tags: Python 3
- Uploaded using Trusted Publishing? No
- Uploaded via: twine/4.0.2 CPython/3.7.1
File hashes
| Algorithm | Hash digest | |
|---|---|---|
| SHA256 |
c5779b75fa2f5b62f45a314a34944d70eeffa40a07930b90f0f981b6fe89c504
|
|
| MD5 |
82b6d749f8bb2592bacee65fb06c2bc8
|
|
| BLAKE2b-256 |
bde630e1dbd315a6671387b481c851f3c001d48e1b7a1611b39df4595b0dbf55
|