当前位置: 首页 > news >正文

听见文本的魅力:AI 与未来的语音交互

AI 与未来的语音交互

      • 引言
      • 什么是文本转语音(TTS)?
      • 当前 TTS 技术现状
      • 国内海外文本转语音能力调研
      • 文本转语音能力说明
        • 多情感风格
        • SSML语音合成标记语言
      • 未来趋势

引言

随着人工智能(AI)技术的迅猛发展,文本转语音(Text-to-Speech, TTS)技术逐渐进入了我们的日常生活中。
已广泛应用于不限于以下示例场景:

  • 流式语音实时翻译对话;
  • 非流式语音对话机器人一问一答式对话;
  • 类似豆包、Kimi等AI工具的智能助手;
  • 用户友好的功能引导提示;
  • 游戏NPC交互;
  • 儿童读物;
  • 影视配音;
  • 电子书;

什么是文本转语音(TTS)?

文本转语音(TTS)是一种将书面文本转换为语音的技术。用户可以通过输入文本,利用 TTS 系统生成听起来自然流畅的语音。TTS 系统通常由以下几个主要组件组成:

  1. 文本分析:解析输入的文本,识别分词、语法、标点和其他语言特征。
  2. 语言处理:根据语言特征,将文本转换为音素(phonemes)和音节(syllables)。
  3. 语音合成:将音素和音节转换为实际声音,通常采用预录音频或合成方式。

当前 TTS 技术现状

  1. 神经网络与深度学习:近年来,随着神经网络和深度学习技术的突破,TTS 的质量得到了显著提升。尤其是 WaveNet、Tacotron 和 FastSpeech 等模型,在合成的自然度和表现力上远超传统 TTS 系统。这些模型能够生成更加流畅、自然的语音,甚至模仿特定说话者的音色。

  2. 多语言支持:现代 TTS 系统已支持多种语言,适应全球用户需求。许多大厂商的 TTS 技术能够处理包括中文、英文、西班牙文等多种语言,并且提供不同地区的口音和方言。

  3. 个性化语音:个性化语音合成技术的出现,使得用户可以定制语音特征,如音调、语速和情感风格。这种个性化的体验在教育和娱乐等领域尤为重要。

国内海外文本转语音能力调研

三方厂商服务多音色SSML标记语言多情感Emotion语速rate音调pitch音量volumeAPI价格备注
出门问问魔音工坊标准音色:100元/百万字符;精品音色:300元/百万字符支持多情感,国内语音合成效果非常好的一款产品,英文语音效果亦佳
阿里云TTS1.80元/千次部分中文音色支持多情感,英文音色不支持多情感
腾讯云语音合成标准音色:0.2元/万字符; 精品音色:0.3元/万字符英文不支持多情感
火山云语音技术5.5元/千次慵懒女声-Ava、情感女声-Lawrence、亲切女声-Anna支持通用、开心、悲伤、生气、害怕、厌恶、惊讶等情感。男声不支持多情感
科大讯飞TTS 1、会员月/45元,权益-80次/天;2、单次付费120字5元;2150字10元;51100字20元;101300字30元;3011000字45元;10015000字78元;5001~20000字168元;图形化操作不支持API,英文不支持多情感
Elevenlabs$99/500min;$330/2000min/英文场景优先推荐,英文音色效果很好;多情感需要文本中包含情感描述,导致合成语音存在情感描述。对情感类支持灵活性低。
Google Cloud标准语音:$4.00/100万字符Neural2 语音:$16.00/100万字符英文语音效果好,可通过SSML实现语音控制
Azure AI$15.00/100万字符英文场景优先推荐,英文音色效果很好;支持多情感音色
AWS Polly标准语音:$4.00/100 万字符; 神经语音:$16.00/100 万字符多情感,只能通过选择不同的音色,配置不同的语速和语调,来表达积极或失落的情感
ArtList$11.99/月,50,000积分(约1个小时音频)语音效果较好。支持多情感,但情感分类较少。图形化操作不支持API
Play.ht$49.00/月,25万字符需要通过声音参数表现力稳定性、声音相似性、情绪强度来调整语音设置;类似elevenlabs,对情感类支持灵活度较低。

文本转语音能力说明

在这里插入图片描述
此处以出门问问的序列猴子开放平台音色为例,介绍下音色主要的能力。
首先音色有分类,男声、女声、儿童、青年、中年、老年、中文、英文、韩语、法语这些最基本的大类。

  • 音色
    每个人的音色都不一样,不同的AI音色也不一样
  • 语速
    控制指定音色制作语音讲话的快慢
  • 音调
    控制指定音色制作语音的音调大小
  • 音量
    控制指定音色制作语音的音量大小
多情感风格

然后重要介绍下音色的多情感风格,训练出一款好的AI音色不局限于一种中性风格。例如出门问问会支持开心、难过、惊喜、生气、呢喃、新闻等各种情感色彩;Azure会支持友好、充满希望、柔和等情感风格;
一个普通的AI模型是没有感情色彩的,通常为中性,通过中性音色制作的语音,听起来有明显的AI感、机械化没有感情色彩。一个支持多情感的音色,是可以处理短文故事文案中各种复杂场景的,且语音合成没有AI感,更接近真实的人声。

此处以Azure AI语音Style为例。

情感风格风格描述
friendly表达一种愉快、怡人且温暖的语气。 听起来很真诚且满怀关切。
hopeful表达一种温暖且渴望的语气。 听起来像是会有好事发生在说话人身上。
whispering表达一种柔和的语气,试图发出安静而柔和的声音。
empathetic表达关心和理解。
chat表达轻松随意的语气。
serious表达严肃和命令的语气。 说话者的声音通常比较僵硬,节奏也不那么轻松。
excited表达乐观和充满希望的语气。 似乎发生了一些美好的事情,说话人对此满意。
SSML语音合成标记语言

正常语音合成输入纯文本即可,语音合成引擎内部会使用基于规则或者统计学习模型的方法,去做文本分析,尝试预测合理的注音和韵律等。
使用SSML标签标记文本中的关键文字,可以指定文字的发音、语速、停顿、多音字处理、情感风格等。提到这些功能,大概可以知道SSML标签可以更加细化的控制我们的语音合成效果。实际生产过程中对制作语音要求高的场景,往往建议你通过SSML标签来控制。

示例:

9月10日,庆祝2019年教师节暨全国教育系统先进集体和先进个人表彰大会在京举行。
XXX在XXX亲切会见受表彰代表,向受到表彰的先进集体和先进个人表示热烈祝贺,向全国广大教师和教育工作者致以节日的问候。

文本转语音API调用:

{"signature": "appkey+secret+timestamp的MD5值","timestamp": "1665717322","appkey": "开发者应用appkey","speaker": "cissy_meet","ignore_limit": true,"gen_srt": true,"audio_type": "mp3","text": "910日,庆祝2019年教师节暨全国教育系统先进集体和先进个人表彰大会在京举行。
XXXXXX亲切会见受表彰代表,向受到表彰的先进集体和先进个人表示热烈祝贺,向全国广大教师和教育工作者致以节日的问候。","speed": "1.0"
}

SSML标签处理后示例:
此处对"教师节"制定了读音及读第几声。通过break控制停顿500ms。更多能力请参考官方文档语音合成标记语言SSML使用说明

<speak version="1.0" xml:lang="zh-CN" xmlns="http://www.w3.org/2001/10/synthesis">9月10日,庆祝2019年<w phoneme="jiao4 shi1 jie2">教师节</w>暨全国教育系统先进集体和先进个人表彰大会在京举行。<break time="500ms" />XXX在XXX亲切会见受表彰代表,<break time="500ms" />向受到表彰的先进集体和先进个人表示热烈祝贺,<break time="500ms" />向全国广大<p phoneme="jiao4"></p>师和教育工作者致以节日的问候。</speak>

文本转语音API调用:

{"signature": "appkey+secret+timestamp的MD5值","timestamp": "1665717322","appkey": "开发者应用appkey","speaker": "cissy_meet","ignore_limit": true,"gen_srt": true,"audio_type": "mp3","text": "<speak version=\"1.0\" xml:lang=\"zh-CN\" xmlns=\"http://www.w3.org/2001/10/synthesis\">9月10日,庆祝2019年<w phoneme=\"jiao4 shi1 jie2\">教师节</w>暨全国教育系统先进集体和先进个人表彰大会在京举行。<break time=\"500ms\" />XXX在XXX亲切会见受表彰代表,<break time=\"500ms\" />向受到表彰的先进集体和先进个人表示热烈祝贺,<break time=\"500ms\" />向全国广大<p phoneme=\"jiao4\">教</p>师和教育工作者致以节日的问候。</speak>","speed": "1.0"
}

未来趋势

  1. 更自然的语音生成:目前的语音合成很多时候虽然还是被吐槽一听就有AI感,但是已存在部分厂商的音色去AI感了。未来的 TTS 技术将继续朝着更高的自然度和声音表现力发展,甚至可能实现像人声一样真实的交互。
  2. 专属AI语音模型训练:目前已经很多厂商在做训练用户专属的AI语音模型,并已经作为功能开放出来,供开发者训练指定音色模型,比如我们投喂姚明的大量的语音资源,可以训练出姚明的音色模型出来。
  3. 情感语音合成:随着情感计算技术的发展,TTS 将能够生成不同情感的语音,自动分析前后文,动态的切换感情色彩,提升人机交互的情感表达能力。
  4. 跨模态学习:结合图像、视频和文本等多种模态的信息处理,未来的 TTS 系统将能够更好地理解上下文,从而生成更恰当的语音输出。
  5. 隐私与安全:随着个人语音数据的增加,确保用户隐私和数据安全将成为 TTS 技术发展的重要课题。

相关文章:

听见文本的魅力:AI 与未来的语音交互

AI 与未来的语音交互 引言什么是文本转语音&#xff08;TTS&#xff09;&#xff1f;当前 TTS 技术现状国内海外文本转语音能力调研文本转语音能力说明多情感风格SSML语音合成标记语言 未来趋势 引言 随着人工智能&#xff08;AI&#xff09;技术的迅猛发展&#xff0c;文本转…...

Qt 窗口可见性 之 close函数和hide函数

close函数 基本功能 close() 方法的主要功能是关闭窗口&#xff0c;并触发一系列与关闭相关的事件和信号。调用此方法后&#xff0c;窗口将不再可见&#xff0c;但窗口对象本身仍然存在&#xff0c;并且可以被再次显示&#xff08;通过调用 show() 方法&#xff09;。 事件处…...

git bisect和git blame

1.用 git bisect 找到出错的commit 设置开始&#xff0c;最新的一个已知的错误的commit和第一个已知的正确的commit&#xff0c;通过二分法&#xff0c;找出第一个出错的commit。 二分查找法&#xff08;binary search method&#xff09;或二分法&#xff08;bisection meth…...

【面试题】Node.JS篇

1. 什么是Node.js?它的主要特点是什么?适用于哪些场景? Node.js 是一个基于Chrome V8引擎的JavaScript运行时环境&#xff0c;它允许JavaScript代码在服务器端运行。Node.js的主要特点是事件驱动、非阻塞I/O模型&#xff0c;这使得它非常适合处理高并发请求和实时应用。它适…...

Leetcode11:盛水最多的容器

原题地址&#xff1a;. - 力扣&#xff08;LeetCode&#xff09; 题目描述&#xff1a; 给定一个长度为 n 的整数数组 height 。有 n 条垂线&#xff0c;第 i 条线的两个端点是 (i, 0) 和 (i, height[i]) 。 找出其中的两条线&#xff0c;使得它们与 x 轴共同构成的容器可以容纳…...

php如何对海量数据进行基数统计

在PHP中&#xff0c;对海量数据进行基数统计通常可以使用布隆过滤器&#xff08;Bloom Filter&#xff09;或者Count-Min Sketch算法。以下是使用Count-Min Sketch算法的一个简单示例&#xff1a; class CountMinSketch {private $rows;private $columns;private $values;publ…...

git命令报错:fatal: not a git repository (or any of the parent directories): .git

当你执行 Git 命令时遇到错误信息 "fatal: not a git repository (or any of the parent directories): .git"&#xff0c;这表明你当前所在的目录不是一个 Git 仓库&#xff0c;或者你的工作目录不在 Git 仓库的根目录下。以下是一些解决这个问题的步骤&#xff1a;…...

如何通过sip信令以及抓包文件分析媒体发到哪个地方

前言 问题描述&#xff1a;A的媒体没转发到B&#xff0c;B只能听到回铃音&#xff0c;没有A的说话声音&#xff0c;并且fs这边按正常的信令发送了. 分析流程 分析早期媒体发送到哪一个IP 10.19.0.1发送了一个请求给10.19.0.157这个IP&#xff0c;然而这里的SDP媒体地址&am…...

【网络安全零基础入门】一文搞懂Javascript实现Post请求、Ajax请求、输出数据到页面、实现前进后退、文件上传

文章目录 一、Javascript原生post请求写法二、原生JS封装Ajax请求三、JS里的值或内容输出到HTML网页中四、Javascript页面后退前进刷新示例五、Javascript实现文件上传&#x1f449;1.成长路线图&学习规划&#x1f448;&#x1f449;2.网安入门到进阶视频教程&#x1f448;…...

NVR管理平台EasyNVR多个NVR同时管理综合应用方案

为了推动应急管理能力的现代化&#xff0c;应急管理部提出了加速现代信息技术与应急管理业务深度融合的宏伟蓝图。这一计划不仅是国家加强和改进应急管理工作的战略重点&#xff0c;也是应对当前应急管理形势的严峻挑战和满足人民群众对公共安全需求的必要举措。 为了实现应急管…...

SpringBoot核心框架之AOP详解

SpringBoot核心框架之AOP详解 一、AOP基础 1.1 AOP概述 AOP&#xff1a;Aspect Oriented Programming&#xff08;面向切面编程&#xff0c;面向方面编程&#xff09;&#xff0c;其实就是面向特定方法编程。 场景&#xff1a;项目部分功能运行较慢&#xff0c;定位执行耗时…...

Linux: network: ifconfig已经过时,建议使用ip addr相关命令

最近有一个同事在问网络的问题,在debug的过程中还在使用ifconfig命令查看IP的相关信息。 但是这个ifconfig已经不推荐使用了,最好使用ip 相关的命令做操作。 有些信息使用ifconfig显示不出来 ifconfig eth0: flags=4163<UP,BROADCAST,RUNNING,MULTICAST> mtu 1500ine…...

Flutter 鸿蒙next中的路由使用详解【基础使用】

✅近期推荐&#xff1a;求职神器 https://bbs.csdn.net/topics/619384540 &#x1f525;欢迎大家订阅系列专栏&#xff1a;flutter_鸿蒙next &#x1f4ac;淼学派语录&#xff1a;只有不断的否认自己和肯定自己&#xff0c;才能走出弯曲不平的泥泞路&#xff0c;因为平坦的大路…...

基于SSM+小程序民宿短租管理系统(民宿1)

&#x1f449;文末查看项目功能视频演示获取源码sql脚本视频导入教程视频 1、项目介绍 基于SSM小程序民宿短租管理系统实现了管理员、用户及房主 1、管理员可以管理民宿信息和订单信息用户管理、房主管理、房间类型管理、预定管理等。 2、房主可以管理自己的民宿和订单 3、…...

SQL LIKE 操作符

SQL LIKE 操作符 在SQL中&#xff0c;LIKE 操作符用于在查询中搜索列中的特定模式。它通常与 % 和 _ 通配符一起使用&#xff0c;分别代表任意数量的字符和单个字符。LIKE 操作符在数据过滤和模式匹配方面非常有用&#xff0c;尤其是在处理大量文本数据时。 LIKE 操作符的基本…...

七款主流图纸加密软件强力推荐|2024年CAD图纸加密保护指南

在当今信息化的设计行业&#xff0c;保护CAD图纸的知识产权和数据安全变得尤为重要。随着越来越多的企业采用数字化设计和共享文件&#xff0c;如何防止CAD图纸被未经授权的访问和窃取成为了许多设计师和企业关注的焦点。为此&#xff0c;选用合适的图纸加密软件是保护CAD文件安…...

【STM32】单片机ADC原理详解及应用编程

本篇文章主要详细讲述单片机的ADC原理和编程应用&#xff0c;希望我的分享对你有所帮助&#xff01; 目录 一、STM32ADC概述 1、ADC&#xff08;Analog-to-Digital Converter&#xff0c;模数转换器&#xff09; 2、STM32工作原理 二、STM32ADC编程实战 &#xff08;一&am…...

C# 委托简述

1.委托 1.1什么是委托 委托委托 官网解释: 委托是安全封装方法的类型&#xff0c;类似于 C 和 C 中的函数指针。 与 C 函数指针不同的是&#xff0c;委托是面向对象的、类型安全的和可靠的。 委托的类型由委托的名称确定。 个人理解:委托就是一个方法的模板。它可以接收…...

瑞吉外卖项目

目录 Day01业务开发 一、项目总体介绍与展示 二、软件开发整体介绍 &#xff08;一&#xff09;软件开发流程 三、瑞吉外卖项目介绍 &#xff08;一&#xff09;项目介绍 &#xff08;二&#xff09;技术选型功能架构 1.技术选型—— ​编辑2.功能架构—— ​编辑 &a…...

Docker:4、龙晰(Anolis OS 8.8)宝塔面板安装

接上文Docker&#xff1a;1、基于龙晰 &#xff08;Anolis OS 8.8 &#xff09;的基础镜像制作&#xff0c;本节我们介绍&#xff1a;基于Docker的龙晰&#xff08;Anolis OS 8.8 &#xff09;宝塔安装。 在第一节中由于我们对 Docker 容器进行了SSH设置&#xff0c;这为我们这…...

AI-调查研究-01-正念冥想有用吗?对健康的影响及科学指南

点一下关注吧&#xff01;&#xff01;&#xff01;非常感谢&#xff01;&#xff01;持续更新&#xff01;&#xff01;&#xff01; &#x1f680; AI篇持续更新中&#xff01;&#xff08;长期更新&#xff09; 目前2025年06月05日更新到&#xff1a; AI炼丹日志-28 - Aud…...

OpenLayers 可视化之热力图

注&#xff1a;当前使用的是 ol 5.3.0 版本&#xff0c;天地图使用的key请到天地图官网申请&#xff0c;并替换为自己的key 热力图&#xff08;Heatmap&#xff09;又叫热点图&#xff0c;是一种通过特殊高亮显示事物密度分布、变化趋势的数据可视化技术。采用颜色的深浅来显示…...

ES6从入门到精通:前言

ES6简介 ES6&#xff08;ECMAScript 2015&#xff09;是JavaScript语言的重大更新&#xff0c;引入了许多新特性&#xff0c;包括语法糖、新数据类型、模块化支持等&#xff0c;显著提升了开发效率和代码可维护性。 核心知识点概览 变量声明 let 和 const 取代 var&#xf…...

ubuntu搭建nfs服务centos挂载访问

在Ubuntu上设置NFS服务器 在Ubuntu上&#xff0c;你可以使用apt包管理器来安装NFS服务器。打开终端并运行&#xff1a; sudo apt update sudo apt install nfs-kernel-server创建共享目录 创建一个目录用于共享&#xff0c;例如/shared&#xff1a; sudo mkdir /shared sud…...

Redis相关知识总结(缓存雪崩,缓存穿透,缓存击穿,Redis实现分布式锁,如何保持数据库和缓存一致)

文章目录 1.什么是Redis&#xff1f;2.为什么要使用redis作为mysql的缓存&#xff1f;3.什么是缓存雪崩、缓存穿透、缓存击穿&#xff1f;3.1缓存雪崩3.1.1 大量缓存同时过期3.1.2 Redis宕机 3.2 缓存击穿3.3 缓存穿透3.4 总结 4. 数据库和缓存如何保持一致性5. Redis实现分布式…...

前端倒计时误差!

提示:记录工作中遇到的需求及解决办法 文章目录 前言一、误差从何而来?二、五大解决方案1. 动态校准法(基础版)2. Web Worker 计时3. 服务器时间同步4. Performance API 高精度计时5. 页面可见性API优化三、生产环境最佳实践四、终极解决方案架构前言 前几天听说公司某个项…...

【JVM】- 内存结构

引言 JVM&#xff1a;Java Virtual Machine 定义&#xff1a;Java虚拟机&#xff0c;Java二进制字节码的运行环境好处&#xff1a; 一次编写&#xff0c;到处运行自动内存管理&#xff0c;垃圾回收的功能数组下标越界检查&#xff08;会抛异常&#xff0c;不会覆盖到其他代码…...

【C语言练习】080. 使用C语言实现简单的数据库操作

080. 使用C语言实现简单的数据库操作 080. 使用C语言实现简单的数据库操作使用原生APIODBC接口第三方库ORM框架文件模拟1. 安装SQLite2. 示例代码:使用SQLite创建数据库、表和插入数据3. 编译和运行4. 示例运行输出:5. 注意事项6. 总结080. 使用C语言实现简单的数据库操作 在…...

Linux C语言网络编程详细入门教程:如何一步步实现TCP服务端与客户端通信

文章目录 Linux C语言网络编程详细入门教程&#xff1a;如何一步步实现TCP服务端与客户端通信前言一、网络通信基础概念二、服务端与客户端的完整流程图解三、每一步的详细讲解和代码示例1. 创建Socket&#xff08;服务端和客户端都要&#xff09;2. 绑定本地地址和端口&#x…...

【VLNs篇】07:NavRL—在动态环境中学习安全飞行

项目内容论文标题NavRL: 在动态环境中学习安全飞行 (NavRL: Learning Safe Flight in Dynamic Environments)核心问题解决无人机在包含静态和动态障碍物的复杂环境中进行安全、高效自主导航的挑战&#xff0c;克服传统方法和现有强化学习方法的局限性。核心算法基于近端策略优化…...