Загрузка видео...

Не удалось загрузить видео

На главную

小道杂谈 · 联合国六种官方语言,最薄的永远是中文那本 同一份文件译成六种官方语言,中文版永远是最薄的那一本。 汉语是语素文字,一个字就是一个意思单位。别的语言得用一串字母才能表示的东西,汉语一个字就装下了,所以又短又准。 短还不算本事,短了还能抒情才叫本事。张若虚那句白云一片去悠悠,翻成任何语言都得掉一半东西:白云、一片、去、悠悠,四个词四层意思,还带着时间在走。 《春江花月夜》被称为孤篇压全唐。我看压的不止全唐。 #命理指南 #小道杂谈 #Enzozhz

14,454 просмотров • 1 месяц назад •via X (Twitter)

Комментарии: 17

Фото профиля Jake
Jake1 месяц назад

文字の密度が高いぶん、翻訳では情報量やニュアンスをどう保つかも大切ですね

Фото профиля 曾小道
曾小道1 месяц назад

中文最难的往往不是把句子压短,而是把冠词、时态、单复数和语气对应出来。字数少了,这些信息很容易藏进上下文。法律和外交文本里,“应当”和“可以”就不能混

Фото профиля 老实人|美股·AI投资
老实人|美股·AI投资1 месяц назад

还是得学好英语~

Фото профиля 曾小道
曾小道1 месяц назад

掌握一门外语,但不一定要是英语🌚

Фото профиля 老实人|美股·AI投资
老实人|美股·AI投资1 месяц назад

英语的沟通广度还是最大的

Фото профиля 清郎
清郎1 месяц назад

“宇宙”两个字就把整个三维世界概括了

Фото профиля 鄭庭沃
鄭庭沃1 месяц назад

中文是美,是精煉,是有效率,重點是真他媽難學,除非是母語人士,學習成本太高,英文之類的就很簡單學

Фото профиля cqwz
cqwz1 месяц назад

傻逼,信息密度高的语言不可能准确因为存在大量复用的符号

Фото профиля 彬彬有礼
彬彬有礼1 месяц назад

表兄,堂兄,叔叔,大爷,舅舅,爷爷,姥爷。

Фото профиля 🎗️十里山径忽飘麦田香 ☭⃠
🎗️十里山径忽飘麦田香 ☭⃠1 месяц назад

这样,你直接说宇宙,把所有东西都给概括了吧

Фото профиля Yves
Yves1 месяц назад

对啊,一句冯福吊打全球

Фото профиля Lloyd 𝕏
Lloyd 𝕏1 месяц назад

峰哥疏油头

Фото профиля Nate H
Nate H1 месяц назад

找个例然后无限放大。 对了尘肺病常用的词是pneumoconiosis

Фото профиля After Offline离线后
After Offline离线后1 месяц назад

老外 学中文可能就感觉难如登天了

Фото профиля 死前幻想
死前幻想1 месяц назад

楔形文字xie1xingwenzi

Фото профиля Jay
Jay1 месяц назад

日本鬼子真猥琐

Фото профиля sqq
sqq1 месяц назад

中文其实就一个词讲明白,写意。至于写实,写实那还叫中文吗?要说如何写意?靠想象呗,想象力有多丰富,中文就有多高深,有多深?博大精深!

Похожие видео

#中文 #语言学 🇨🇳🇹🇼🇭🇰🇲🇴🇸🇬🇲🇾🇯🇵… 看到五岳散人等说中文不必学。我不知道这些人是否有意识到,他们的声量既不等于学识更不等于力量。因为社科往往无法证伪,所以观点常常大行其道于事实之前。 关于事实,我尽力讲得简单一点,尽可能不用语言学学术名词。 中文有几个知名的特征: 一,它是目前使用最多的象形文字,其他象形文字几乎仅剩学术界在使用; 二,象形(语素文字)导致它着重意象沟通,朝鲜语和藏语存在类似特征; 三,象形中文在商周、春秋战国,经历了两次大规模的造字运动,在秦汉的汉字统一运动后,便因自身的复杂性和难以记忆的特征,而迅速进入了造词、造意、同音异意化运动中; 到南北朝时期,游牧民族、百越和佛教语言大量涌入中国,例如“哥哥”(鲜卑语)“幸福”“未来”(佛语)等词汇,将字形已高度复杂化的汉语,引导向了造词和造意运动,造字运动从此趋于结束。在今天,人们阅读自南北朝以降1500年间之汉文,基本都能够直接读懂。 四,中文是亚洲语言的超级聚合体。南方汉语充斥着客家话、沪语、闽南话、粤语等部分白话了的古汉语;北方则大量融合了少数民族的语言习惯,比如常见的倒装句、儿化音、叠词称谓等,都来自于游牧民族语言习惯。 奠定了普通话的东北话、北京话和满语极为相近,满语又深刻影响了朝鲜语;满语和蒙语起源自古鲜卑语,古鲜卑语又很可能对日语产生过极大影响,不过都不是决定性的——日韩语言起源自其本土。 五,复杂的象形文字,导致中国古代惜字如金,将意象表达几乎运用到了极致,也导致对语法的重视程度很低;因为准确的语法意味着更多的文字使用。这究竟是有意还是无意之结果,学界观点不一。 不过,这最终所产生之影响,是中国的语言形式逻辑的匮乏,今日中国的所谓“因为..所以”等极为简单的语言逻辑,亦通过日语汉译由西方传入中国。更枉论其他的复杂语言结构。 六,在世界主流语言中,中文是一种信息熵最高的语言,高达9.56-9.65比特间。这和中文高度重视意象表达的特征直接相关,也与对语法的大量省略有关。从日常表达的角度来看,中文应当具有非常高的高效性。 但也正是因为缺乏对语法的重视,使得中文内容常常变得云里雾里,使其在实际使用中,缺乏了充分利用其原本应当具有的高效性。 七,中文有一些非常特殊的优势。日韩等拼音语言翻译外文时,常常是完全音译,日语甚至要专门使用大量复杂的无意义假名,如果不了解这一假名词的含义,则根本无法理解原意。 比如,“维他命”,即使没有学过相关知识,汉语言人群看到这三个字就能猜出个大概,但日语假名是ビタミン(びたみん)他们其实更多使用的还是日语汉字“维生素”。 这会产生一个显著的结果。中文知识间的门槛是非常低的,人们进入各学科时并没有“字”上的障碍,障碍多来自对“词意”的理解。这也是为什么,像“量子物理佛学”这种莫名其妙的知识能够广为流传,因为这六个字中国人都能读懂,只是这三个词的含义很少有人能直接理解。 但是,在拼音语言中,你没学过那个词就是没学过,必须要知道意,才能知道这个词到底是什么含义;否则常常连盲猜都困难。 八,这就引出了另外两个问题。第一,汉语言的总字量和总词量都远少于拼音语言;第二,汉语言的造词运动的动力远弱于拼音语言。 以越南语这一特殊语言为例。自推行罗马化以来,越南语总词汇量在三十年里,从八万词迅速增长到了三十三万词。 为了满足北中南不同语言习惯之需求,越南还无法像秦汉一样强行统一文字,它必须不断地让越南语复杂化,才能纳入不同地方之语言习惯;而拼音语言大幅降低了越南语复杂化的门槛,加个音标、多个声调,就可以解决第一个地方人群的语言被排斥感。 汉语连造个新字都难,造个长词也非常受语言习惯的抵触,因为长词往往和省略语法的句子越来越相似,容易导致高度复杂化的意象。 这直接使得汉语言地区失语症患者远少于西方。对于母语者,汉语言的学习也简单于拼音语言,许多新词会读即可,无需专门学习读音与含义。这同样导致了一种超稳定性社会。 九,汉语有利于维护统一。现代民族国家观念是指,一种语言、一种文化、一种人群认同,即可公投建立一个民族国家。拼音语言很容易小群体化,也就是方言化,这类似于拼音语言在学术语言中常常创造出的学科间的语言障碍。 汉语没有这种问题。即使是在不同语言间(如现代汉语和粤语),书面沟通仍然完全可行。甚至我们今天写汉字和日本人沟通都没问题。这导致汉语言国家很难实际解体。因为在非强制手段下,不会出现因语言沟通障碍的解体。 十,汉语言的抽象的意象特征和语法的匮乏,导致它很不利于数码语言,如计算机等。拼音语言因普遍的罗马化,则很容易在匹配英文后,契合于数码语言。不过伴随技术进步,这种问题并不像上世纪末那般严重了。 对于我来说,中文是一定要学的,我深爱它的美。

Angelo Wong

105,820 просмотров • 2 лет назад

先讲一个你可能从来没听说过的人。 1930年,英国语言学家 C.K. Ogden 做了一件很偏执的事——他把整个英语词汇表研究了一遍,然后问了一个问题:如果只能留下最核心的那些词,英语还能不能用? 他的答案是:850个词,够了。 这850个词,不是随便选的,是他穷尽分析之后筛选出来的"语言骨架"。他把它们分成5类: 100个操作词(Operations):这、那、是、有、做……就是那些让句子转起来的胶水词 400个普通事物(General Things):名词里最高频、最基础的那层 200个可描绘事物(Picturable Things):能画出来的具体东西,比如 door、fire、river 100个性质词(Qualities):描述世界的形容词,比如 clear、simple、important 50个反义词(Opposites):成对出现,学一个等于学两个 —————— 然后他把这套体系命名为 Basic English,发表出来。 接下来发生的事情更有意思。丘吉尔在二战期间公开赞扬这套体系,认为它是盟国推广英语教育的最佳基础。H.G. 威尔斯把它写进了《世界大战》的续集设定里,作为未来世界通用语言的蓝图。乔治·奥威尔……没有赞扬它,但《1984》里那套压缩语言"新话"(Newspeak)的灵感,正是来自对 Basic English 的深深警惕——他担心语言被缩减之后,人的思想也会跟着被缩减。 这就是这850个词的能量:支持者觉得它是桥梁,批评者觉得它是枷锁,争论了将近一百年。 但我想说的不是那场争论。我想说的是——这850个词,对今天的英语学习者来说意味着什么。 大多数人学英语,是被一本本厚厚的词汇书和无尽的考纲压着学的。CET-4、CET-6、托福、雅思……每一个证书背后都是几千个词的暴力记忆,背了忘,忘了背,从来没有真正"用"过。 Ogden 给出的逻辑完全相反:不是多,而是深。 这850个词,每一个都是高频中的高频,每一个在日常英语表达里都有不可替代的位置。当你真正把这850个词学透——不只知道它的意思,还知道它的用法、它的近义词在什么场景该用哪一个——你对英语的掌握会比背了5000个词却每个只认识中文意思要扎实得多。 这是一种截然不同的语言观:根扎得够深,枝才能生得够远。 —————— 于是我做了这个网站: (准确的说我让 Codex 做的) 原版 Ogden 的资料是一本PDF,黑白的,排版像上个世纪(它确实是上个世纪的)。我想让它变成真正可以用来学习的东西。 花了不少时间(花了不少 Token )最终做成了这样: 每一个词,都有一张完整的卡片。 卡片上有:这个词的中文释义、英文定义(用简单的英语解释英语,就像 Ogden 本人的风格)、一句真实语境下的例句,以及2到3个同义词。五个类别各有自己的颜色,一眼就知道你在学哪个区域的词汇。 每一个词,都可以听发音。 接的是有道词典的语音接口,默认英式发音,可以切换美式。点单词听一次,点例句听一次,语速比正常稍慢一点,适合跟读。不是那种机械的合成音,真的可以听。 最让我花心思的,是同义词那里。 很多人背单词的时候,同义词只是"差不多的意思"。但真正用英语的时候,difference 和 distinction 不一样,speak 和 talk 不一样,simple 和 easy 不一样。差在哪里?什么场景该用哪个? ——————— 网站是免费的,不需要注册,不会收集任何信息。 直接访问就行: 如果你身边有正在学英语的人,或者觉得自己英语"学了很多年但还是用不好"的,可以发给他们看看。 也许这850个词,是一个值得重新开始的起点。 👆 以上的文案也是它写的,我越来越没有用了

虎小象

978,876 просмотров • 4 месяцев назад

大家默认 奥特曼的Whisper 是 语音识别(ASR) 天花板。 我用四川话测了一句:巴适。 Whisper 听成了八式,它从没学过四川话。 同一批音频,Hojo-ASR-Multi-V1:错误率0.0%。 接着,我给了它们一段成都街头的环境音,全程没有一个人说话。 · Whisper 吐出 100 个 嗨 · Hojo 吐出 5 个字符 两个都幻觉了,但一个是 100 字,一个是 5 字。嘈杂街头声音解码,是常用的场景。 我用两个模型做了详细评测。最有意思的是 Hojo 的底座 —— 语音编码器来自 Qwen3-Omni-30B,语言解码器是 Qwen3-4B。 🚀一个文本大模型,凭什么能做语音识别? 因为 ASR 从来就是两半:声学 + 语言。 「bā shì」这个音,在波形里根本分不出是「巴适」还是「八式」—— 声音里没有这个信息。能定夺的只有语言知识:哪个词真的存在、在这个语境里说得通。 Qwen3-4B 读过整个中文互联网,知道「巴适」是个四川话词。 🔥接法很巧:训练一个适配器,把音频编码成2560维向量,刚好Qwen3-4B刚好接受2560 维。 两个数字一对上,Qwen 就以为自己在读词,其实在听声音。 所以这不是从头训语音识别模型,而是后训练:拿 Qwen3-4B 当初始化权重,连同音频编码器一起全参数微调。 我把它的解码器和原版 Qwen3-4B 逐层比对过,每一层都有变化。所以不是白嫖 Qwen 的语言知识,避免了从零预训练语言能力。这条路叫 Encoder-Adapter-LLM。 最后还有一个牛逼的点: Open ASR Leaderboard全球第 7,开源多语言 ASR 第 1。 五语种平均 WER 3.54%,而且权重开放、评测公开、结果可复现。 现已支持四川话、广东话小语种。 Apache 2.0 开源。

实践哥 Li

47,158 просмотров • 19 дней назад

印度正在干一件大事。 一件很安静,但可能影响深远的事。 他们在从零开始,构建一个梵语大语言模型。 梵语,是世界上最古老的结构化语言。 这个项目,不是简单的翻译工具。 更不是把古籍扫描数字化就完事了。 他们要让AI真正“学会”梵语,用梵语的逻辑去思考。 牵头的是一家有118年历史的梵语学院,和印度顶尖的理工学院IIT马德拉斯分校。 学者和数据科学家坐到了一起。 第一步,也是最难的一步,建立语料库。 他们收集了超过11万份梵文文本。 包括经文、孤本、还有数千份手稿。 为了处理这些古老的手稿,团队自己开发了专有软件。 结果惊人。 24小时内数字化了超过1000本梵语书籍。 每页只有三到四个错误,准确率接近97%。 梵语的语法结构极其复杂和精确。 比如“Sandhi”这种连音变化规则,还有复杂的词形变化,对AI的挑战远超英语。 解决这些难题,需要全新的算法和模型。 这暴露了一个关键问题。 当下的AI模型,本质上是基于英语世界的逻辑和数据结构建立的。 而印度这个项目,试图用一种完全不同的文明底层逻辑来训练AI。 这不仅仅是技术问题。 这关乎一个文明的记忆,能否在机器时代被完整保留,甚至被激活。 当全球科技巨头都在追求更大规模的模型、更快的算力时,印度选择了一条不同的路。 深度优先,而非规模。 结构优先,而非噪音。 意义优先,而非模仿。 这引出了一个更深层的问题。 AI的未来,是否也依赖于人类最古老的智慧? 如果这个实验成功,梵语将不再仅仅是被“保存”的遗产。 它将成为一种可计算的,具备严谨逻辑推理能力的工具。 这是一个国家在尝试用自己的文化之根,去定义自己的科技未来。 而不是被动地接受硅谷制定的标准和游戏规则。 这种对自己文明的自信和投入,值得深思。 当一个国家开始系统性地将自己的古典智慧与最前沿的科技结合,它的目标可能远不止是开发一个AI模型那么简单。

墓碑科技

22,272 просмотров • 7 месяцев назад

这项目我可太爱了!! 一个哥们把1324个健身动作全整理完了,英文、西班牙语、意大利语、土耳其语、俄语、中文,六种语言的动作讲解全翻好了。 本来这事你至少得雇两个人,一个整理数据,一个翻译。现在一个开源仓库,建表SQL、API代码、连LLM提示词都给你写好了,复制粘贴就能用了。 我最近减肥中,打算自己搞个小程序,监督训练,就看到了这个宝藏项目。 其实,做健身产品最头疼的从来不是UI界面。是把1324个动作挨个录完,把英文讲解一字一句翻成中文,再琢磨数据存哪、怎么让App读到这些数据。这堆东西,一个人干至少两周,外包出去少说两万。 这个仓库把三件事全替你干了。打开这个仓库你能拿到什么: 1324个动作的数据库,按部位、器械、目标肌肉全部分好了,拿来就能用 六种语言的讲解翻译全齐,不用自己雇人译 选个数据库类型,建表代码自动生成,不用从零建库 接口直接给你写好,七八种语言都能跑,改个地址就行 最狠的,连让AI帮你生成整个后端的提示词都写好了 数据录好了,六种语言翻好了,数据库怎么建也用不着你想了。打开setup.html,选一下你用的数据库类型,四五个主流的一列都支持,建表代码直接生成。 你连接口都不用自己看代码写了,选完框架和数据库,它给你生成一段提示词,直接甩给Claude或者GPT,一条消息整个后端就出来了。 老王自己跑了一趟,先做了个网页版吧,半小时全通了,六种语言的接口一个没落。 你也可以尝试一下,做一个自己的健身管家。

产品经理老王霸

34,487 просмотров • 2 месяцев назад

学好英语的含金量有多高, 看看沈阳这个83年的女局长, 靠英语两年从副处干到了正处。 那些天天说“AI都能翻译了还学英语干嘛”的人,真该看看彭勃的履历。 83年生,英语专八,从翻译做起,2024年6月还是文旅局副局长,11月靠着英语和东北话无缝切换卖大米火遍全网,2025年平调去做招商,2026年2月直接竞聘上自贸区正局长。 从副处到正处,她只用了不到两年,而这一路一直在给她开路的,就是英语。 总有人说她是运气好,赶上流量了。 可东北那么多文旅局副局长,英语好的也不止她一个,为什么偏偏是她火了、升了? 因为镜头怼到脸上的时候,她张嘴就是标准英语,转头就能切回东北话跟你唠大米,自然、大方、不怯场、有梗,这本事不是天上掉的,是做了那么多年翻译练出来的。 机会砸到你头上的时候,你得有本事接得住。 所以别拿AI翻译当你不学英语的借口, 恰恰是AI能翻译了,那些只会蹦单词、看个短文的半吊子才彻底没用了; 但真能流利谈判、能跟外国人交成朋友、能在正式场合镇得住场、说话带着自己温度和风格的人,反而比以前更稀缺。 AI能给你翻字面意思,翻不了酒桌上你跟客户一句地道玩笑拉近距离的交情,翻不了谈判桌上你听懂对方言外之意的默契,翻不了你站在镜头前双语自由切换的那份自信。 彭勃的故事最打动人的我觉得其实不是她升得快,是她证明了:一门学透了的硬技能,永远不会骗你。 它不会今天学了明天就给你回报,但一定会在某个你根本想不到的时刻,给你一个别人抢都抢不走的机会。 相信我兄弟们,你现在背的每个单词、练的每句口语、看的每部无字幕电影,都不是白费的。 以后别再说学英语没用了,也许那只是你还没到能用它的层级而已。

AYi

117,786 просмотров • 1 месяц назад