文本到语音

共 23 篇网址

排序

发布更新浏览点赞

OuteTTS-0.1-350M

OuteTTS-0.1-350M是一款基于纯语言模型的文本到语音合成技术，它不需要外部适配器或复杂架构，通过精心设计的提示和音频标记实现高质量的语音合成。该模型基于LLaMa架构，使用350M参数，展示了直接使用语言模型进行语音合成的潜力。它通过三个步骤处理音频：使用WavTokenizer进行音频标记化、CTC强制对齐创建精确的单词到音频标记映射、以及遵循特定格式的结构化提示创建。OuteTTS的主要优点包括纯语言建模方法、声音克隆能力、与llama.cpp和GGUF格式的兼容性。

010

文案写作 # 声音克隆 # 文本到语音 # 语言模型

ElevenLabs Voice Design

ElevenLabs Voice Design是一个在线平台，允许用户通过简单的文本提示来设计和生成定制的声音。这项技术的重要性在于它能够快速创建出符合特定描述的声音，如年龄、口音、语气或角色，甚至包括虚构角色如巨魔、精灵和外星人。它为音频内容创作者、广告制作者、游戏开发者等提供了一个强大的工具，可以用于各种商业和创意项目。ElevenLabs提供了一个免费试用的机会，用户可以注册后尝试其服务。

020

设计助手 # AI音频 # 声音设计 # 多语言支持

VALL-E 2

VALL-E 2 是微软亚洲研究院推出的一款语音合成模型，它通过重复感知采样和分组编码建模技术，大幅提升了语音合成的稳健性与自然度。该模型能够将书面文字转化为自然语音，适用于教育、娱乐、多语言交流等多个领域，为提高无障碍性、增强跨语言交流等方面发挥重要作用。

020

语音处理 # 人工智能 # 文本到语音 # 自然语言处理

Llasa-3B

Llasa-3B 是一个强大的文本到语音（TTS）模型，基于 LLaMA 架构开发，专注于中英文语音合成。该模型通过结合 XCodec2 的语音编码技术，能够将文本高效地转换为自然流畅的语音。其主要优点包括高质量的语音输出、支持多语言合成以及灵活的语音提示功能。该模型适用于需要语音合成的多种场景，如有声读物制作、语音助手开发等。其开源性质也使得开发者可以自由探索和扩展其功能。

010

文案写作 # 中英文支持 # 开源模型 # 文本到语音

Fish Speech V1.2

Fish Speech V1.2是一款基于300,000小时的英语、中文和日语音频数据训练而成的文本到语音（TTS）模型。该模型代表了语音合成技术的最新进展，能够提供高质量的语音输出，适用于多种语言环境。

010

语音处理 # 多语言支持 # 开源 # 文本到语音

Auralis

Auralis是一个文本到语音（TTS）引擎，能够将文本快速转换为自然语音，支持语音克隆，并且处理速度极快，可以在几分钟内处理完整本小说。该产品以其高速、高效、易集成和高质量的音频输出为主要优点，适用于需要快速文本到语音转换的场景。Auralis基于Python API，支持长文本流式处理、内置音频增强、自动语言检测等功能。产品背景信息显示，Auralis由AstraMind AI开发，旨在提供一种实用于现实世界应用的文本到语音解决方案。产品价格未在页面上明确标注，但代码库在Apache 2.0许可下发布，可以免费用于项目中。

020

文案写作 # Python API # tts # 文本到语音

Bailing-TTS

Bailing-TTS是由Giant Network的AI Lab开发的大型文本到语音(TTS)模型系列，专注于生成高质量的中文方言语音。该模型采用持续的半监督学习和特定的Transformer架构，通过多阶段训练过程，有效对齐文本和语音标记，实现中文方言的高质量语音合成。Bailing-TTS在实验中展现出接近人类自然表达的语音合成效果，对于方言语音合成领域具有重要意义。

010

语音处理 # Transformer # 半监督学习 # 文本到语音

CSM 1B

CSM 1B 是一个基于 Llama 架构的语音生成模型，能够从文本和音频输入中生成 RVQ 音频代码。该模型主要应用于语音合成领域，具有高质量的语音生成能力。其优势在于能够处理多说话人的对话场景，并通过上下文信息生成自然流畅的语音。该模型开源，旨在为研究和教育目的提供支持，但明确禁止用于冒充、欺诈或非法活动。

020

文案写作 # 多说话人 # 开源模型 # 文本到语音

OuteTTS-0.2-500M

OuteTTS-0.2-500M是基于Qwen-2.5-0.5B构建的文本到语音合成模型，它在更大的数据集上进行了训练，实现了在准确性、自然度、词汇量、声音克隆能力以及多语言支持方面的显著提升。该模型特别感谢Hugging Face提供的GPU资助，支持了模型的训练。

020

文案写作 # 声音克隆 # 多语言支持 # 文本到语音

Voice Clone

MyVocal.ai_一种快速简便的方法来克隆您的声音以供唱歌或说话

020

AI赋能 AI音频工具 # AI乐曲 # AI创作音乐 # AI歌手

Kokoro-82M

Kokoro-82M是一个由hexgrad创建并托管在Hugging Face上的文本到语音（TTS）模型。它具有8200万参数，使用Apache 2.0许可证开源。该模型在2024年12月25日发布了v0.19版本，并提供了10种独特的语音包。Kokoro-82M在TTS Spaces Arena中排名第一，显示出其在参数规模和数据使用上的高效性。它支持美国英语和英国英语，可用于生成高质量的语音输出。

010

文案写作 # 开源模型 # 文本到语音 # 语音合成

Dia AI

Dia 是一个由 Nari Labs 开发的文本到语音（TTS）模型，具有 1.6 亿参数，能够直接从文本生成高度逼真的对话。该模型支持情感和语调控制，并能够生成非言语交流，如笑声和咳嗽。它的预训练模型权重托管在 Hugging Face 上，适用于英语生成。此产品对于研究和教育用途至关重要，能够推动对话生成技术的发展。

020

文案写作 # AI # 声音克隆 # 对话生成

Fish Agent V0.1 3B

Fish Agent V0.1 3B是一个开创性的语音转语音模型，能够以前所未有的精确度捕捉和生成环境音频信息。该模型采用了无语义标记架构，消除了传统语义编码器/解码器的需求。此外，它还是一个尖端的文本到语音(TTS)模型，训练数据涵盖了700,000小时的多语言音频内容。作为Qwen-2.5-3B-Instruct的继续预训练版本，它在200B语音和文本标记上进行了训练。该模型支持包括英语、中文在内的8种语言，每种语言的训练数据量不同，其中英语和中文各约300,000小时，其他语言各约20,000小时。

020

文案写作 # 多语言支持 # 文本到语音 # 语音转语音

zeroscope_v2_XL

管道标签不在官方列表中

010

AIGC影视平台 AI视频模型 # 句子相似性 # 可视化问题解答 # 图像分割

Voice Forge

Voice Forge是一个简单而有趣的应用程序，可以帮助您创建和许可文本到语音音频，使您的音乐、游戏或视频脱颖而出。

010

文字转语音音频AI # 数字语音创建 # 文本到语音

pdf-to-podcast

pdf-to-podcast是一个基于人工智能技术的生产力工具，能够将PDF文档转换成播客节目。它使用OpenAI的文本到语音模型和Google Gemini技术，将PDF内容处理成适合音频播客的自然对话，并输出为MP3文件。该工具的主要优点是能够将静态的文档内容转化为动态的音频内容，方便用户在移动设备上收听，同时也可以作为播客节目的内容来源。

010

语音处理 # 人工智能 # 播客制作 # 文本到语音

Text to Santa Videos by Gan.AI

Text to Santa Videos by Gan.AI是一个在线平台，允许用户创建个性化的圣诞老人视频，为亲人和朋友带去节日的问候。该平台通过节日主题的虚拟形象、个性化剧本和直接发送到邮箱的视频，提供了一种新颖的个性化视频制作和分享方式。它结合了最新的人工智能技术，如文本到语音和头像APIs，以及视频录制和个性化功能，使得用户可以大规模地录制和个性化视频。产品背景信息显示，该平台已经为成千上万的客户生成了数百万视频，并且具有强大的功能，如AI唇形同步和声音克隆、免费视频录制器、AI着陆页等。价格方面，用户可以免费开始使用，具体定价信息需要访问官方网站查询。

020

文案写作 # AI技术 # 个性化视频 # 唇形同步

Voice Cursor

Voice Cursor是一个基于Gemini 2.0原生音频能力的实验性文本编辑器，它展示了如何将Gemini的新文本到语音API集成到文本编辑器中，以实现流畅、上下文的声音生成。这个项目不仅展示了Gemini 2.0的强大新功能，还提供了一个实际应用的示例，允许开发者和用户探索和利用这一新技术。产品背景信息包括Google Creative Lab的创新项目，旨在推动技术边界并提供新的交互方式。产品目前是免费的，主要面向开发者和技术爱好者，适合那些寻求创新解决方案以提高生产力和无障碍访问的个人或团队。

020

文案写作 # Gemini 2.0 # Google Creative Lab # 实验性项目

OptiSpeech

OptiSpeech是一个高效、轻量级且快速的文本到语音模型，专为设备端文本到语音转换设计。它利用了先进的深度学习技术，能够将文本转换为自然听起来的语音，适合需要在移动设备或嵌入式系统中实现语音合成的应用。OptiSpeech的开发得到了Pneuma Solutions提供的GPU资源支持，显著加速了开发进程。

030

语音处理 # 文本到语音 # 深度学习 # 端到端模型

OpenVoiceChat

OpenVoiceChat是一个开源项目，旨在提供一个与大型语言模型（LLM）进行自然语音对话的平台。它支持多种语音识别（STT）、文本到语音（TTS）和LLM模型，允许用户通过语音与AI进行交互。项目采用Apache-2.0许可，强调开放性和易用性，目标是成为封闭商业实现的开源替代品。

020

语音处理 # 开源 # 文本到语音 # 自然语言处理

Paper-to-Podcast

Paper-to-Podcast是一个将学术论文转换成播客形式的工具，通过模拟三个人的讨论来让听众以更自然和人性化的方式理解论文内容。它不仅使复杂的信息更易于吸收，还提供了宝贵的洞见和批判性思考。该工具使用了OpenAI API进行文本到语音的转换，生成具有不同角色特点的逼真声音，使得听众可以在通勤或旅行时通过听而不是读来吸收研究论文的内容。

030

文案写作 # API # OpenAI # 学术

MaskGCT TTS Demo

MaskGCT TTS Demo 是一个基于MaskGCT模型的文本到语音（TTS）演示，由Hugging Face平台上的amphion提供。该模型利用深度学习技术，将文本转换为自然流畅的语音，适用于多种语言和场景。MaskGCT模型因其高效的语音合成能力和对多种语言的支持而受到关注。它不仅可以提高语音识别和合成的准确性，还能在不同的应用场景中提供个性化的语音服务。目前，该产品在Hugging Face平台上提供免费试用，具体价格和定位信息需进一步了解。

040

文案写作 # Hugging Face # 文本到语音 # 深度学习

Text to Speech & AI Voice Generator

介绍使用 ElevenLabs 的 AI 音频创建逼真的语...

080

音频 # AI 音频 # 内容创作 # 商业解决方案