Skip to main content

中文是不是更适合LLM?


  1. 中文本身就是一种很厉害的抽象

    1. 树干,树皮,树根

    2. 葡萄,葡萄干,葡萄酒

    3. 都是对自然现象的一种很高级的抽象方法

    4. 甚至树干和葡萄干的 还是同音不同义

    5. 为什么把主干和缺水这两个意思安排到一个汉字里面?

      1. 为了尽量提高信息密度的同时,提高区分度,减少汉字数量?
  2. 反复读和看同一个汉字,大脑会觉得这个字很奇怪,很陌生

    1. 核心现象与机制:盯着同一个字看久了会觉得陌生,这种现象在学术上被称为“语义饱和”(Semantic Satiation)。其本质是负责识别字形和提取语义的神经元因过度刺激而产生保护性抑制,导致“视觉符号”与“语义理解”的通路被临时切断。
    2. 抽象结构的坍缩:大脑平时能直接提取汉字的整体语义;发生语义饱和时,高级抽象瞬间解构,汉字还原为单纯的几何线条与图形,因此让人感到陌生。
    3. 符号与意义的脱钩:这一现象揭示了文字符号与客观含义之间的绑定关系是人为建立的。汉字由于具备独特的形体结构,这种抽象解构带来的陌生感比其他文字更为强烈。
  3. LLM内部为了信息表达效率,肯定学会这样的抽象

    1. 输入一个葡萄干,肯定会同时增强葡萄和缺水的语义
    2. 从实际现象来说,语言只是换个符号,是什么语言,只是最后的字词的映射关系的区别
    3. 按照现在的模型设计和训练方法,应该和语言关系不大
  4. 那么如果利用中文重构训练会不会提高能力?