字符混淆实验

在这篇文章中,Cyrillic 指与拉丁字母构成大量混淆对的西里尔文字脚本。分析显示,常见西里尔小写字母如 а 与 a、е 与 e、о 与 o 等在 macOS 超过 40 种标准字体中像素完全相同,SSIM 达到 1.0。这种字体设计中的字形复用使其成为视觉欺骗的主要威胁,与希腊文或阿拉伯文等较低风险脚本形成明显对比,文中据此将 82 个像素相同对列为高危案例。

Cyrillic

学习中文时的 18 条思考

本文中用于标注汉字读音的罗马化拼写系统,作者全文以此标注发音。用户在手机或电脑上输入拼音后选择对应汉字即可完成输入,无需手写。文章指出,掌握拼音后只需识别汉字即可打字,极大降低了书写汉字的门槛。

汉语拼音

学习中文时的 18 条思考

文章说明中文作为声调语言,“ma”音节依四声加轻声可分别表示母亲、麻木、马、骂或疑问助词。但作者认为声调辨识难度被夸大,语境通常能消除歧义,且无需刻意记忆也能达到约70%的正确率。

声调语言

学习中文时的 18 条思考

本文称上海话属于吴语语系,与普通话、粤语分属不同语族,相互无法理解,差异程度相当于英语与德语或瑞典语。上海本地传统语言,约30%中国公民在家使用非普通话方言,其中包括上海话等地方话。作者以此说明普通话推广前中国语言环境的复杂性。

上海话

学习中文时的 18 条思考

文章指出上海话属于吴语语系,与普通话或粤语分属不同语系,对未接触者而言无法理解,其差异程度相当于英语与德语或瑞典语。约30%的中国人在家中使用非普通话,这类地方话使普通话对许多人而言相当于外语。

吴语

学习中文时的 18 条思考

本文指出粤语与普通话仅远亲关系,许多人低估了中国语言多样性,粤语只是其中之一。作者强调,即使认识粤语,仍远不足以覆盖中国实际存在的语言差异。

粤语

学习中文时的 18 条思考

本文指中国官方推广的标准汉语,以北京方言为基础,学校教学全部使用普通话。约30%的中国公民在家说非普通话语言,对他们而言普通话相当于外语。政府通过学校政策加速其普及,内部移民也推动了这一趋势,使普通话逐渐成为跨地区沟通的主要工具。

普通话

外星语应该更奇怪一些

语用学层面涉及使用者如何通过隐喻、转喻或蕴含传达超出字面意义的内容。文中以塔马利安人语言为例,他们更关注寓言关联而非字面含义。若与语义差异叠加,这种语用差异会使交流更加复杂怪异。

语用学

外星语应该更奇怪一些

本文指出,为虚构作品设计的人造语言主要从语言学中借鉴人类语言的规则框架。尽管它们可采用独特词汇或打破部分语法限制,但本质仍依赖地球语言的熟悉元素,如名词、动词及主谓宾结构。这导致现有设计无法充分探索外星语言的广阔可能性,作者呼吁突破这种局限。

人造语言

外星语应该更奇怪一些

本文区分两种不可翻译性:一种是外星表达指涉人类未发现的对象,可通过新词解决;另一种是语义层面差异,即外星语言的意义类型反映不同世界分类方式,人类缺乏对应认知范畴而无法匹配。文章以库恩的质量概念为例说明激进不可翻译性,但也提到真假、描述等概念可作为接触点。

不可翻译性

外星语应该更奇怪一些

语义学在文中被定义为语言元素如何指称世界对象或表达事实的层面。外星语言若在此层面不同,可能使用人类无法把握的分类方式,导致根本不可翻译的问题。作者指出真假、描述等概念仍可作为连接点,帮助匹配对应元素。

语义学

外星语应该更奇怪一些

本文将会话含义归入语用层面,指说话者通过特定表达传达字面之外的意思,例如用“我和伴侣在一起”委婉拒绝舞伴邀请。文章指出外星文明可能采用不同隐喻、转喻或交际规范,从而产生不同于人类的会话含义。若此类差异与语义层面的根本不同叠加,沟通难度将大幅增加。

会话含义

外星语应该更奇怪一些

本文以电影《降临》中的七肢桶为例,其书写为圆形墨迹状,表面陌生,但仍使用名词动词等熟悉语法范畴,可被翻译成英语,只是存在“工具”误译为“武器”的情节。文章强调其实际并不如可能的外星语言那般彻底陌生。

七肢桶

外星语应该更奇怪一些

符号层面指语言中可产生或交换的基本元素,包括声音、文字、手势或图像。文中提到外星语言可采用全新模态,如蜜蜂舞蹈般的身体动作或机器间的电脉冲。即使结构和意义相同,仅符号差异已使语言显得极为陌生。

符号学

外星语应该更奇怪一些

本文指出《星际迷航》中的克林贡语虽有独特发音和句法,但仍包含名词、动词、主语宾语等人类语言的结构元素,与多斯拉克语、纳美语等虚构语言类似。文章认为此类语言在符号和结构上稍异,却未真正触及语义或语用层面的根本陌生。

克林贡语

外星语应该更奇怪一些

句法学对应文章中的结构层面,涵盖词语内部构成、语法类别及句子组织规则。作者设想外星语言可能缺乏名词动词区分,或采用单一类别词语,甚至类似地图的自动更新元素。这会产生人类语言中不存在的全新语法类型。

句法学

荷马史诗中的三维空间感知

本文将信息结构视为当前学界解释荷马名词短语词序的主要框架:当形容词承载更突出的对比信息时前置,名词在前则表示中性或名词更重要。该框架主要从旁观者或作者视角分析句子信息分配,未系统纳入文本内人物的内在动机与身体感知。

信息结构

荷马史诗中的三维空间感知

本文核心探讨荷马名词短语中形容词与名词的词序,提出其反映观察者沿左右上下前后轴的注意方向与情感认知。NA对应正面或被观察者负面,AN相反;非默认状态下两者互换。

词序

荷马史诗中的三维空间感知

本文分析形容词修饰的名词短语(AN或NA)如何记录观察者的空间感知与镜像关系。右向NA用于自身正面方向或被观察者负面,左向AN则指向自身负面或被观察者正面,偏离默认状态时规则反转。

名词短语

荷马史诗中的三维空间感知

句法指示指语法形式图式化记录观察者的空间感知正确性与自我意识:默认状态下NA指向自身正方向或他人负方向,AN则相反;非默认状态则反转。该机制使词序成为检测人物感知扭曲或知识差异的工具,体现具身认知对语法的塑造。

句法指示

荷马史诗中的三维空间感知

本文聚焦古希腊语荷马史诗中形容词修饰的名词短语词序问题,提出其由观察者的自我中心视角与空间感知决定,而非单纯信息结构。NA与AN结构分别对应不同注意方向与情感认知状态,规则在非默认感知下会颠倒。

古希腊语

SIL 许可详解

本文介绍的语言与识字组织,专门为字体创建了SIL Open Font License。该许可旨在平衡字体设计师的控制权与公众使用自由,尤其支持少数语言字体的传播与文化保护,成为字体开源领域的重要规则制定者。

SIL International

The hidden power of typography

文中介绍Kiki和Bouba实验:95%的人将尖锐形状与“Kiki”、柔和形状与“Bouba”对应。研究显示,当字体与文字含义一致时(如Impact配“truck”),阅读速度更快;反之则变慢。该效应说明字体与内容和谐可提升影响力,不和谐则增加批判性。

Kiki and Bouba effect

各个地区语言是怎么在网上「笑」的

文中以lmao为例说明英语笑声缩写的细微差别,并提到希伯来语用למאו对应lmao,体现该缩写在不同书写系统中的传播。

LMAO

各个地区语言是怎么在网上「笑」的

文章指出英语使用者熟悉haha、lol、lmao等表达不同笑声强度的用法,将其作为跨语言对比的起点,说明lol在多语种中被音译或直接借用。

LOL

一些漫画结构和技巧分享

本文提到Neil Cohn博士为漫画学者与教育者,其著作《Speaking in Pictures》将在5月30日的学术活动上被Reimena Yee介绍。活动聚焦漫画学术进展及创作者与学者的合作。

Neil Cohn

一些漫画结构和技巧分享

Contraction指连续面板或分隔线尺寸逐渐缩小,用于加快叙事节奏或制造特定唤起效果。本文将其列为独立设备条目,并配有专门页面说明其视觉功能。

Contraction

蒸汽波与 Unicode 分析

本文提及Gretchen McCulloch的著作《Because Internet》,用以说明互联网写作便于分析的特点,并以此类比vaporwave文本研究的可行性与价值。

Because Internet

蒸汽波与 Unicode 分析

文中引用语言学家Gretchen McCulloch在《Because Internet》中的观点:互联网文本易于大规模分析,能为经典语言学问题提供新洞见;作者借此逻辑转向对vaporwave文本的量化研究。

Gretchen McCulloch

多邻国使用 Rive 的案例

Phoneme指Duolingo自研语音识别模型提取的发音单元,包含每个单词和音素的精确时间戳。系统把这些时间信息映射到Viseme上,从而驱动Rive动画实现精准口型同步。

Phoneme

维吾尔族书写系统改革文章

维吾尔语将其改造为严格音素文字,而非多数语言采用的辅音音素模式。改革者通过重拼写借词、清理多余辅音并创新表示八个元音,实现了完整音素对应,还首创连字断行。

Arabic script

维吾尔族书写系统改革文章

维吾尔语使用的阿拉伯文字形式,已从传统阿布贾德转为纯音素文字。历经1937至1983年的多次改革,新增字母表示全部元音和辅音,并允许单词在行末断开。

Uyghur Arabic alphabet

维吾尔族书写系统改革文章

阿拉伯文字传统使用模式,仅标记辅音而省略多数元音。维吾尔语打破此常规,通过重拼写和新增字母将其改造为完整音素文字系统。

Abjad

维吾尔族书写系统改革文章

土耳其凯末尔改革采用的纯音素文字系统。与维吾尔语坚持改造阿拉伯文字不同,土耳其选择转向拉丁文字并移除大量阿拉伯借词。

Latin script

维吾尔族书写系统改革文章

本文提及维吾尔语曾在1937至1983年间短期使用过西里尔字母(以及拉丁字母),但最终选择保留并改革阿拉伯字母体系,使其从辅音音素文字转向严格的音素文字。

Cyrillic

维吾尔族书写系统改革文章

指完整记录所有音素的文字系统。维吾尔语将阿拉伯文字改造为纯音素模式,明确区分八个元音,实现了一对一音素对应,并支持连字断行。

Phonography

机器翻译的过去、现在和未来

早期机器翻译采用基于规则的方法,目标是让计算机掌握多语言词汇与语法实现自主翻译;1954年IBM 701用此方法翻译俄语化学句,1976年加拿大气象系统用于法英天气预报,但语法问题导致资金削减,后被统计方法取代。

基于规则的机器翻译

机器翻译的过去、现在和未来

道格拉斯·亚当斯小说中的虚构生物巴别鱼具备通用同声传译能力;1997年Altavista推出的在线翻译服务以其命名,首次向大众免费开放英语等六种语言互译,但仍面临语义消歧难题。

巴别鱼

机器翻译的过去、现在和未来

1947年3月,洛克菲勒基金会主管Warren Weaver致信Norbert Wiener,提出翻译问题可能等同于密码学问题,这一观点直接启发了战后政府资助的早期机器翻译研究。

Warren Weaver

机器翻译的过去、现在和未来

本文作者Julia Errens追溯了从图灵时代到谷歌翻译的机器翻译发展历程,梳理了早期政府资助项目、基于规则的系统演进,以及统计方法兴起的脉络,强调机器翻译从军事应用转向民用服务的轨迹。

Julia Errens

机器翻译的过去、现在和未来

1960年Bar-Hillel在论文中以“小约翰找玩具盒,pen里找到了”为例,论证全自动高质量翻译不可行,指出机器缺乏文本外常识无法解决歧义问题。

Yehoshua Bar-Hillel

机器翻译的过去、现在和未来

本文将谷歌翻译描述为基于统计机器翻译的在线服务,目前覆盖约80种语言。它依靠海量平行文本训练,用户可提交改进建议以优化结果。作者指出其在科技文本上表现较好,但在文化或口语化内容上仍存在明显局限。

谷歌翻译

Fredrick Brennan 谈 Twitter 新字体 Chirp

Brennan发现Chirp中重音符后的空白约为正常的两倍,影响排版。文章认为这是Twitter匆忙推出字体导致的另一技术缺陷,后续可修复。

重音符

机器翻译的过去、现在和未来

1985年欧盟委员会推出的Eurotra项目,是当时西方最大规模的基于规则机翻努力,目标是实现欧洲经济共同体九种官方语言之间的互译,标志机翻从军事转向民用领域。

Eurotra