又发现 GitHub 上一款开源强大的文本转语音工具:Abogen。 能快速将 ePub、PDF 或文本文件转换成高质量音频,并生成匹配的字幕。 GitHub: 主要特性: -... show more

GitHubDaily
31,126 views • 1 year ago
#工程师工具 看到一个在线文字转语音的工具「TTSMaker」,提供语音合成服务,支持多种语言以及各种风格,可以用它朗读文本或者合成视频声音,可完全免费用于商业场景,弄好后直接下载文件,普通用户每周限制 20000 个字符使用,基本够用。 🤖

Tw93
105,715 views • 3 years ago
找了很久的本地格式转换工具,终于找到完美方案。 VERT - 开源转换神器 ✓ 完全本地运行(基于 WebAssembly) ✓ 无文件大小限制... show more

katon
23,717 views • 8 months ago
在 GitHub 上发现一款完全本地运行的开源 AI 助手:Eclaire,集成了超多 AI 功能。 支持文档、图片、笔记、书签等数据类型的统一管理,并通过本地 LLM... show more

GitHubDaily
26,221 views • 10 months ago
一款轻量级的音频转文本开源免费工具:Youtube-Whisper。 只需输入 YouTube 视频链接,即可提取其中音频,并利用 OpenAI Whisper 模型进行语音转文本。 GitHub: 工具提供了在线免费体验地址,可选择英语、西班牙语、法语等语言。 在线体验:

高军
29,747 views • 1 year ago
Glarity 插件 - 基于 ChatGPT 和 YouTube 字幕生成视频摘要 不得不说,这个插件实在是太强了,可以提前预定我的年度插件之选了😆... show more

千寻|AI 分享 🌸
48,000 views • 3 years ago
在 GitHub 上发现了一个 Notion 和 Slack 的开源平替方案:Colanode,本地优先,数据隐私安全。 作为开源协作平台,功能颇为全面,集实时聊天、文档编辑、数据库管理和文件存储于一体。 GitHub:... show more

GitHubDaily
27,276 views • 1 year ago
分享 GitHub 上一款能自动生成 Cursor 高质量的 MDC 规则文件开源工具:MDC Rules Generator。... show more

GitHubDaily
28,985 views • 1 year ago
又发现一款跨设备文件分享的开源免费工具:Croc,可以放弃使用网盘或硬盘了。 无需在同一网络下,允许任意两台电脑之间传输文件或文件夹,不限制大小,并提供端到端加密,更安全更快速地分享。 GitHub: 除此之外,还支持多文件传输,以及中断后的断点续传功能。 支持 Windows、Linux 和 macOS 一键安装使用。

GitHubDaily
53,589 views • 1 year ago
一款高效的开源浏览器翻译插件:FluentRead。 可以将网页上的文字翻译成任何语言,支持 20+ 种翻译服务,包括DeepL 翻译、DeepSeek、OpenAI等。 GitHub: 此外,还支持双语对照,并提供丰富的自定义选项,让阅读更加流畅高效。 目前已上架各大浏览器商店,可以安装体验下。

GitHubDaily
21,633 views • 1 year ago
阿里刚刚开源了TTS:Fun-CosyVoice3 0.5B,zero-shot音色克隆,可本地部署 还开源了款ASR【Fun-ASR-Nano 0.8B】,Fun-ASR的轻量化版本,推理成本更低,可以本地及定制化微调 另外,Fun-CosyVoice3模型做了升级,首包延迟比之前降低了50%,WER降低了56.4%,复杂场景字符错误率降低了26% 支持9种通用语言、18种中文方言、9种情感控制,可以跨语种音色复刻,比如说,用一段普通话录音可生成粤语、日语、英语等 支持双向流式合成,“输入即发声”,这个适用于语音助手、直播配音、无障碍阅读等等实时场景 Fun-ASR也升级了,噪声场景下准确率到了93%,新增歌词与说唱识别能力,支持31种语言自由混说无需预先指定语种 覆盖7大方言和26种地方口音,流式识别模型的首字延迟降低到了160ms... show more

AIGCLINK
35,159 views • 7 months ago
字节、港中文等最新搞了一个专用于人-物交互的端到端视频生成模型:OmniShow,妥妥的电商广告专用模型 全模态,一个模型通吃图+音+姿势+文本输入 任务可以覆盖R2V、RA2V、RP2V、RAP2V四种生成模式,目前应该是唯一一个支持同时用图像+音频+姿势+文本混合输入的 人脸保持、物理合理性、表现力及口型同步看起来效果都还可以 原生长镜头生成,最长可生成10秒连续视频 目前代码还没放出来 #人物视频生成模型 #OmniShow #电商视频生成

AIGCLINK
22,713 views • 3 months ago
千问开源Qwen3-TTS 除了常规的文本生成语音,还支持设计声音和语音克隆。分0.6B和1.7B两个大小。效果不错,速度也很快。语音克隆的音色还原还可以,但是情感还原上不如Index TTS2。 模型: 在线体验:

Gorden Sun
18,202 views • 6 months ago
Fun-CineForge:阿里开源的AI生成影视配音 输入视频+文本,AI生成配音,能识别多个角色,能按要求设置配音风格,生成的配音节奏与视频里说话的唇形同步。演示视频的声音效果非常好。 项目地址: 模型:

Gorden Sun
27,036 views • 4 months ago
做自媒体之后,我的下载文件夹,基本长期失控。 素材、品牌资料、截图、PDF 全堆在一起。 今天要交付内容时,我打开文件夹—— 80 个文件,完全炸了 于是,让 AI 接管了我的电脑... show more

暖暖爱AI
41,471 views • 5 months ago
如何高效获取中英文区最有价值的信息流? 这两个是社区普遍推荐的免费开源工具,能自动抓取中英文区全网热点、AI筛选高价值内容、生成翻译+深度分析简报并一键推送👇 1. TrendRadar(58k+ stars) 中文区:自动抓取知乎、抖音、B站、微博、今日头条等11+主流平台 + RSS热点,AI筛选高价值内容,生成分析简报,支持微信/TG/飞书/钉钉/Bark推送 GitHub:... show more

梭哈.AI
65,236 views • 2 months ago
又在 GitHub 上发现一个专为快速构建 Web 应用的强大 AI 编程助手:Claudable。 将本地 CLI... show more

GitHubDaily
11,926 views • 11 months ago
来个本地 RAG 框架 Lobe Chat,这个框架在 Github 上已经有59K Star了。 Lobe... show more

karminski-牙医
23,518 views • 1 year ago
Memo AI 1.3.5 重磅更新,支持纯本地离线说话人识别分类!隐私会议,对话场景不用上传云端也能区分说话人。当然还有: 1. Cuda 模式转写速度较 GPU 提升... show more

Memo AI
34,902 views • 2 years ago
在 GitHub 上发现一款能真正自主完成任务的 AI 桌面 Agent:NeuralAgent,解放我们双手,自动操作电脑。 它能直接在桌面上执行各种操作,如打字、点击、浏览网页、填写表单、发送邮件,甚至可以在后台自动完成复杂任务。 GitHub: 主要特性:... show more

GitHubDaily
16,761 views • 1 year ago