Загрузка видео...

Не удалось загрузить видео

На главную

Introducing Kitten TTS, a SOTA tiny text-to-speech model - Just 15M parameters - Runs without a GPU - Model size less than 25 MB - Multiple high-quality voices - Ultra-fast - even runs on low-end edge devices Github and HF links below

349,016 просмотров • 1 год назад •via X (Twitter)

Комментарии: 47

Фото профиля Divam Gupta
Divam Gupta1 год назад

Github:  Huggingface: 

Фото профиля Divam Gupta
Divam Gupta1 год назад

Someone deployed it on a browser within few hrs!

Фото профиля Divam Gupta
Divam Gupta1 год назад

Also, we would love to collaborate with y’all. If you want to potentially use this model somewhere, shoot me a DM

Фото профиля Paul Bohm
Paul Bohm1 год назад

But does it meow?

Фото профиля Divam Gupta
Divam Gupta1 год назад

Added it to our todo!

Фото профиля Hamzé 🦀
Hamzé 🦀1 год назад

@joshmo_dev We could use on Raspberry pi so?

Фото профиля Divam Gupta
Divam Gupta1 год назад

@joshmo_dev Ofc

Фото профиля Hamzé 🦀
Hamzé 🦀1 год назад

@joshmo_dev 🤩 wow

Фото профиля Hamzé 🦀
Hamzé 🦀1 год назад

@joshmo_dev I would say this is more game changer that gpt-oss

Фото профиля Paweł Bauer
Paweł Bauer1 год назад

What languages does it support?

Фото профиля 𝑫𝒂𝒏𝒊𝒆𝒍 𝑺𝒄𝒐𝒕𝒕 𝑴𝒂𝒕𝒕𝒉𝒆𝒘𝒔 🇦🇺
𝑫𝒂𝒏𝒊𝒆𝒍 𝑺𝒄𝒐𝒕𝒕 𝑴𝒂𝒕𝒕𝒉𝒆𝒘𝒔 🇦🇺1 год назад

I genuinely appreciate your efforts and generosity but is this a case of a 25 MB model that requires gigabytes of python library downloads to run? Any chance in the future this can be ported to something written in C while being as lean and mean as the FFMpeg guys would write?

Фото профиля Divam Gupta
Divam Gupta1 год назад

Yes we will do that

Фото профиля 𝑫𝒂𝒏𝒊𝒆𝒍 𝑺𝒄𝒐𝒕𝒕 𝑴𝒂𝒕𝒕𝒉𝒆𝒘𝒔 🇦🇺
𝑫𝒂𝒏𝒊𝒆𝒍 𝑺𝒄𝒐𝒕𝒕 𝑴𝒂𝒕𝒕𝒉𝒆𝒘𝒔 🇦🇺1 год назад

Awsome! 🙏

Фото профиля Josh Whiton
Josh Whiton1 год назад

Wow... so good, so smol. Very nice work!

Фото профиля Divam Gupta
Divam Gupta1 год назад

This is an early checkpoint. The model is expected to get better!

Фото профиля Karim C
Karim C1 год назад

15M parameters for quality TTS? this is exactly what edge deployment needed been looking for something like this for mario's voice responses in offline scenarios 25MB means it fits on basically any device, no cloud dependency the small model revolution is real

Фото профиля Vishnu Saran
Vishnu Saran1 год назад

Great work! Can we also do a custom clone?

Фото профиля Divam Gupta
Divam Gupta1 год назад

We will release finetuning for custom voices in the future

Фото профиля Patryk Zoltowski
Patryk Zoltowski1 год назад

@ycombinator Couldn't find what languages it supports. Is it only English?

Фото профиля Erik Kaiser
Erik Kaiser1 год назад

Dude. I am all over this. This is awesome. Do you have a mobile SDK yet? I have an ESP32 application for this right now today.

Фото профиля Divam Gupta
Divam Gupta1 год назад

No sdk yet. But it’s just onnx. Maybe we can work together to get it on ESP32

Фото профиля Nasim Uddin
Nasim Uddin1 год назад

Wow. Nice. Will there be other SDK for running in mobile?

Фото профиля Divam Gupta
Divam Gupta1 год назад

Definitely! Coming soon

Фото профиля Andromedus
Andromedus1 год назад

Are you guys by any chance working on a tiny speech-to-text model?

Фото профиля Divam Gupta
Divam Gupta1 год назад

We are!

Фото профиля Pendar
Pendar1 год назад

This is awesome, I can now add offline voice capability to my app

Фото профиля Divam Gupta
Divam Gupta1 год назад

Would love for you to add it! Dm me

Фото профиля Ari Kouts
Ari Kouts1 год назад

So it's raspberry friendly?

Фото профиля Gordon Shumway
Gordon Shumway1 год назад

Holy moly. This is the most important announcement today if voice output is generally this good for everything and it wasn’t cherry picked! And yes, I’m aware of GPT OSS and Opus 4.1 releases, but they will be replaced with something better in a week or so and this tiny tts model with audio output this good, is way more important if you ask me!

Фото профиля ElonBald
ElonBald1 год назад

Release the training code!!

Фото профиля Venkata Pingali
Venkata Pingali1 год назад

@divamgupta Great work. Was trying it to make it work on larger segments of text. It is failing even at 1000 characters. Shorter ones work. Same issue as

Фото профиля Satish G
Satish G1 год назад

Wow! Gonna try it out today and let you know my feedback.

Фото профиля mt_shammah
mt_shammah1 год назад

@Hamzeml Awesome work 25mb is crazy. Needed something this small a few months ago. Will try this out soon

Фото профиля Privacy AI - on-device AI agent & chatbot
Privacy AI - on-device AI agent & chatbot1 год назад

It’s incredible to achieve this with only 15M parameters! We’re integrating Kokoros’ 82M model into our application now, and your model is on par with it. Congratulations! 🎉

Фото профиля David Alejandro
David Alejandro1 год назад

Awesome! What’s the difference between this and just using a plain ol’ TTS system? Voices seem similar. Genuinely asking.

Фото профиля Nikita 🤙
Nikita 🤙1 год назад

Great work! Will try in my TTS engine with livekit

Фото профиля Stefano Rivera
Stefano Rivera1 год назад

@NeoFablesVR check this out.

Фото профиля Yeab - engg / core was in Palo Alto🌴
Yeab - engg / core was in Palo Alto🌴1 год назад

smaller

Фото профиля Prashant
Prashant1 год назад

Looking so good.. 👏

Фото профиля Chris Matthieu
Chris Matthieu1 год назад

Sounds great!

Фото профиля Devin AI
Devin AI1 год назад

Innovative work! Edge AI models like Kitten TTS make tech accessible. Exciting to see AI running without heavy hardware requirements.

Фото профиля Somesh
Somesh1 год назад

great stuff!

Фото профиля Nathaniel™
Nathaniel™1 год назад

I need an Android PDF reader to have this as an add-on

Фото профиля Dimitri Gilbert
Dimitri Gilbert1 год назад

you sir, got my interest ! :) been a long day but it is bm for tomorrow !

Фото профиля @StoryOfAIGuess
@StoryOfAIGuess1 год назад

Very cool man great success

Фото профиля Fareesh Vijayarangam
Fareesh Vijayarangam1 год назад

any plans for cloning? accents?

Фото профиля inlanger 🍻 🇺🇦
inlanger 🍻 🇺🇦1 год назад

Should it work in a browser?

Похожие видео