Skip to main content
Advanced Search
Search Terms
Content Type

Exact Matches
Tag Searches
Date Options
Updated after
Updated before
Created after
Created before

Search Results

190 total results found

SVO语义检索的系统化方案

算法&模型 SVO

SVO 语义检索的系统化方案 本方案描述的是检索架构。SVO 算子定义、原子分类、拓扑模型、可读性建议等基础规范见 SVO语义矢量算子手册.md;大脑记忆四大机制的生物学原型见 大脑记忆的核心机制.md。本文不重复上述内容,只在关键处回指。 立场:入库拆解、门控字段、边权分化、基础激活等全部是工程需要。表达层的算式只需满足手册的硬性约束(§1.1),工程层单向从合法算式中抽取所需字段。任何为让检索工作而反向约束表达的规则,都不应出现在手册或指令文档中。 零、方案概要 一句话:检索 = 概念向量入口 + 类型化...

SVO语义矢量算子手册

算法&模型 SVO

SVO 语义矢量算子手册 一、核心哲学 1.0 基本原则:自然语言投影(最高约束) SVO 是自然语言的格式化投影。 它不是独立于自然语言的形式化系统——而是给自然语言添加最少符号,把隐含结构显式化。语序、词项、修饰关系尽量保留原句;只在歧义、辖域、命题关系等必须显式化的地方引入符号。 合法性检验的唯一标准:算式按结合律回读为自然语言,应与原句语义接近。读不回去的算式就是错的,即使它通过了所有形式规则。 本手册 §二 至 §七 的所有具体规则都是"辅助工具",不是"凌驾检验"。当具体规则与原句表达冲突时,除硬性约...

AI需要明确的信息

基本问题

AI 需要明确的信息 它擅长什么、为什么、边界在哪 背景:AI 写代码这类「明确、定义清楚」的活又快又稳,碰到模糊的事就时灵时不灵。 疑问:它擅长的到底是「编程」,还是背后更一般的东西?本质是什么?该把任务改成什么样?边界又在哪? 论点:AI 不真创新,只是在「它的内嵌空间」和「你的要求」之间取一个最优中点。要求越明确,中点越被拉到你要的那个点上——这就是它为什么需要明确的信息;而当要求拴不上、残差扛不住、或样本不够密时,中点拉不动,那就是它的边界 一、AI 擅长「明确、定义类」的问题——代码是典型 在明确、...

直觉并不落后_合并提纲

基本问题

直觉并不落后 从 AI 的边界,看人的位置 背景:AI 越来越强——能作诗、能生成视频、能写代码,看着像要无所不能。 疑问:可它到底止于哪、为什么?而它够不到的地方,是不是恰恰是人最该站的位置? 论点:直觉与第一性原理不落后,正是人超越「解题机器」的关键 一、AI 是台越来越强的「解题机器」 现在已经成的 作词、作诗 视频生成与修改:关羽弹吉他、名人虚构照片 应用大爆发:编程、问答、领域知识(金融/医疗/法律)、生活服务、信息娱乐、企业加速、科研、工业自动化、教育 还会更强——能力三要素都还有巨大空间 ...

信息压缩-封装算力-技术共识

算法&模型 Transformer

AI的发展实际上是在追求更高的层级的信息压缩 CNN的卷积核是对图像的信息压缩 多层神经网络是在压缩/抽象自然语言表达的语义 从压缩的角度来看,就是用这个模型来压缩真实文本,平均还要花多少bit,才能把下一个token写出来? 不断得更高维度的压缩才是重点 用自然语言来思考是llm这一层的最大作用,自然语言天然就是一个高度压缩的表达方式 推理技术的加成,让自然语言完全发挥,本质上是更高一层维度的抽象/表达/压缩 大模型本身这一层封装了海量算力 大语言模型不仅仅是权重的变大,通过推理技术,表达了更庞大算力...

充分利用算力的精度

基本问题

我们都知道现在的深度神经网络有大量的信息是冗余的,利用这个冗余进行提高效率的计数有,稀疏计算、低精度量化等等技术。 乘法本来就是一种数学上的定义,可以理解成一种最简单的信息处理方法、公式 硬件实现FP32单元实际上是按照数学定义的浮点计算去等价, 神经网络不像科学计算,其在算法设计上就不需要这么高的精度表达 神经网络算法本身就没有办法用到这么高的精度 可以从两个方面来看一下这个问题 硬件为什么FP32就是浪费? 为什么科学计算就是需要FP32甚至是FP64,而神经网络是没有办法?还是没有必要? 再进行一下...

AI底层技术的这几年

基本问题

开始于卷积神经网络 依稀记得AI框架的鼻祖是caffe 后面的pytorch和tensorflow的出现逐渐把深度神经网络的引用慢慢推向成熟 后面就开始进入到了框架的竞争和底层图编译框架的竞争 tensorflow vs pytorch mlir vs tvm 我们都知道胜者是mlir+pytorch 因为这两个分别代表了两个需求的极致 mlir的在图编译以及不同硬件体系对接上的优势 pytorch在上层易用性上的优势 总结 其实不仅仅是框架的技术路线的竞争,也深深影响了国内AI加速芯...

翻倍的本质

基本问题

马丁格尔策略(Martingale Strategy),俗称“加倍赌注法”或“倍投法”,是博弈论和金融学中最著名、最古老,但也最危险的资金管理策略之一。 它的基本逻辑非常直观:“只要我无限翻倍,输多少次都能在一把里全部赢回来。” 为什么翻倍这个工具那么的特殊,在很多地方都可以看到?隐隐约约好像代表了一个很复杂的概念,虽然表面上看起来很简单。 翻倍是什么 X2 把过去的历史的一个完全的总结,表达 一笔勾销,我们最后赌一次 指数爆炸,“棋盘上的麦粒”(或“国王与国际棋盘的故事”) 翻倍代表了一种什么样子的机制? ...

人脑-背景思维

基本问题

当下做主的,是临时判断和情绪 有趣的现象:等红灯的时候,掏出手机看了一眼,发现自己买的股票跌得很厉害,一整片很绿很绿,绿得刺眼。心情一下子起了波动,乱乱的。就在这时,交通灯也变绿了——同样是绿,这一个却是"走",该踩油门了;可内心一阵害怕,手脚发僵,不敢启动车子。 论点:人脑工作的一个有趣机制——当下做决定,占主导的是临时的判断逻辑和情绪 那一刻,理性不在台上:灯绿就走才是理性答案,可人没照它做。 真正当家的是两样东西(还互相喂): 临时的判断逻辑——大脑当场拼出一个"现在很危险",不去核对"股票跟开...

语言模型究竟能记住多少内容?

AI加速芯片 Binary AI

论文阅读笔记:How much do language models memorize? 论文基本信息: 标题:How much do language models memorize?(语言模型究竟能记住多少内容?) 作者:John X. Morris 等(由 Meta FAIR, Google DeepMind, NVIDIA 等机构的研究人员联合发表) 核心主题:大语言模型(LLM)的记忆容量量化、泛化能力与“顿悟(Grokking)”现象。 1. 研究背景与动机 (Motivation) 核心痛点:在...