Mehdi Allahyari's banner
Mehdi Allahyari's profile picture

Mehdi Allahyari

@MehdiAllahyari12,885 subscribers

Entrepreneur | Building AI products to serve at scale. https://t.co/5Rp10wtYhW, https://t.co/hAIZWTfSfL, https://t.co/QhHeAZi9Yz, English account: @MehdiYarix

Videos

MehdiAllahyari's profile picture

من یک مدل تبدیل متن به گفتار (TTS) فارسی آموزش دادم که روی CPU اجرا می‌شه. یک مدل ۱۰۰ میلیون پارامتری که از یک مدل معلم ۲۴ لایه distill شده و از صفر روی ۴۹۷ ساعت گفتار فارسی با لایسنس عمومی CC0 آموزش دیده؛ داده‌هایی از Mana-TTS، فیلیمو و زیرنویس‌های یوتیوب. مدل می‌تونه فقط با چند ثانیه صدای ورودی، صدای گوینده رو تقلید کنه و روی CPU، بسیار سریع‌ اجرا بشه. این مدل بر پایه‌ی pocket-tts ساخته شده که توسط kyutai توسعه داده شده. تا جایی که من بررسی کردم، این اولین مدل فارسی در لیست community-models خود pocket-tts محسوب می‌شه و یکی از معدود مدل‌های TTS فارسیه که واقعاً روی CPU با سرعت قابل استفاده اجرا می‌شه. بیشتر مدل‌های متن‌به‌گفتار متن‌باز برای فارسی، و حتی خیلی از زبان‌های دیگه، عملاً فرض می‌کنن که یک GPU در اختیار دارید. نکته جالب‌تر اینه که دانشجوی ۶ لایه در تمام معیارهایی که اندازه‌گیری کردم، از معلم ۲۴ لایه خودش بهتر عمل کرد: نرخ خطای کلمات (WER)، شباهت گوینده و کیفیت ادراکی صدا. البته یک محدودیت واقعی هم وجود داره که بهتره صادقانه بهش اشاره کنم: در فارسی، اضافه (ezafe)،(کسره ربط بین اسم و صفت/مضاف‌الیه)، معمولاً در نوشتار مشخص نمی‌شه. بنابراین مدلی که متن خام رو می‌خونه، باید اضافه رو از روی context حدس بزنه و گاهی هم اشتباه می‌کنه. حتی نمی‌شه این مشکل رو صرفاً با اضافه کردن دستیِ علامت‌ها حل کرد، چون در داده‌های آموزشی، این علامت‌ها تقریباً هیچ‌وقت به شکل یکدست و consistent نوشته نشده‌اند. بنابراین pipeline پردازش متن هم باید اون‌ها رو حذف کنه. همه‌چیز رو عمومی کردم: اسکریپت‌های آموزش، pipeline ارزیابی، یک runbook مرحله‌به‌مرحله و توضیحات کامل پروژه. توی ویدیو کامل توضیح دادم. ۲تا نکته: توی ویدیو گفتم "فاین تیون" که درست نیست. آموزش کامل دادم روی زبان فارسی. و اینکه گفتم ۷۰۰ ساعت که ۵۰۰ ساعت دیتا بود. 🤗 مدل: 💻 کد و توضیحات کامل:

Mehdi Allahyari

58,188 Aufrufe • vor 8 Tagen

MehdiAllahyari's profile picture

الان داشتن رزومه شخصی سازی شده برای هر شغل خیلی ضروریه! اگر می‌خواهید رزومه‌ای داشته باشید که هم ساختار مهندسی داشته باشد و هم چشم‌نواز باشد، حتما به ریپوزیتوری RenderCV سر بزنید. این ابزار سرعت و دقت کارتان را چند پله بالاتر می‌برد. راحت میتونید رزومه‌تان را مثل یک حرفه‌ای مدیریت کنید و از شر دردسرهای ورد (Word) و به‌هم‌ریختگی‌های چیدمان خلاص بشید. ایده اصلی اینه: محتوا رو از ظاهر جدا کن. دیگه لازم نیست نگران باشی که اگه یه خط به سوابق کاریت اضافه کنی، کل فونت‌ها و فاصله‌های رزومه‌ات به هم می‌ریزه. تو فقط متنت رو توی فایل YAML می‌نویسی، RenderCV خودش بقیه‌ی کارها (چیدمان، فاصله‌گذاری، فونت و...) رو انجام میده. چه ویژگی هایی داره؟ - مدیریت ورژن‌کنترل: می‌توانید رزومه‌تان را در گیت‌هاب قرار دهید و تمام تغییرات آن را در طول زمان ردیابی کنید. - ظاهر بی‌نقص: دیگر نیازی نیست ساعت‌ها وقت صرف تنظیم فاصله‌ها و فونت‌ها کنید؛ همه‌چیز طبق استانداردهای حرفه‌ای چیده می‌شود. - خروجی‌های متنوع: علاوه بر نسخه PDF، به شما فایل‌های Markdown و LaTeX هم می‌دهد که برای پلتفرم‌های مختلف عالی است. - تمرکز روی محتوا: شما فقط روی نوشتن تجربیاتتان تمرکز می‌کنید و اجازه می‌دهید ابزار، کارِ طراحی را برایتان انجام دهد. Github:

Mehdi Allahyari

55,468 Aufrufe • vor 8 Monaten

MehdiAllahyari's profile picture

کمپانی HuggingFace اومده و وب سایت paperswithcode را دوباره راه اندازی کرده و کلی هم چیز بهش اضافه کرده. از جمله این قابلیت‌ها: - نمایش مقالات ترند بر اساس سرعت رشد ستاره‌های GitHub - دسته‌بندی بر اساس حوزه‌های مختلف، مثل OCR، مدل‌های Embedding یا Agentها - پشتیبانی از «روش‌ها» (Methods) که قبلاً در PwC وجود داشت؛ مثلاً RLVR - نمایش نتایج ارزیابی (Eval) برای مقالات مهم و تأثیرگذار؛ مثلاً نتایج Qwen 3.5 در انتهای صفحه - لیدربوردهای اختصاصی برای هر حوزه، مثل MMTEB یا COCO val 2017 - پشتیبانی از تعداد استنادها (Citation Count)؛ حتی می‌تونید پراستنادترین مقالات هر حوزه رو هم ببینید - استخراج خودکار لینک‌های GitHub، صفحات پروژه و آرتیفکت‌های Hugging Face (همچنین از چندین ریپازیتوری برای یک مقاله هم پشتیبانی می‌شه) - پشتیبانی از مقالات خارج از arXiv؛ مثلاً DeepSeek v4 - گزارش‌های Harness برای بنچمارک‌های ایجنت های کدنویس (Coding Agents)، مثل Terminal Bench - ورود با حساب Hugging Face و استفاده از Storage Bucketها برای ذخیره تصاویر thumbnails، فایل‌های PDF مقالات و بکاپ‌گیری از داده‌ها Link:

Mehdi Allahyari

14,584 Aufrufe • vor 3 Monaten