Advanced Search
Search Results
170 total results found
直觉并不落后_合并提纲
直觉并不落后 从 AI 的边界,看人的位置 背景:AI 越来越强——能作诗、能生成视频、能写代码,看着像要无所不能。 疑问:可它到底止于哪、为什么?而它够不到的地方,是不是恰恰是人最该站的位置? 论点:直觉与第一性原理不落后,正是人超越「解题机器」的关键 一、AI 是台越来越强的「解题机器」 现在已经成的 作词、作诗 视频生成与修改:关羽弹吉他、名人虚构照片 应用大爆发:编程、问答、领域知识(金融/医疗/法律)、生活服务、信息娱乐、企业加速、科研、工业自动化、教育 还会更强——能力三要素都还有巨大空间 ...
信息压缩-封装算力-技术共识
AI的发展实际上是在追求更高的层级的信息压缩 CNN的卷积核是对图像的信息压缩 多层神经网络是在压缩/抽象自然语言表达的语义 从压缩的角度来看,就是用这个模型来压缩真实文本,平均还要花多少bit,才能把下一个token写出来? 不断得更高维度的压缩才是重点 用自然语言来思考是llm这一层的最大作用,自然语言天然就是一个高度压缩的表达方式 推理技术的加成,让自然语言完全发挥,本质上是更高一层维度的抽象/表达/压缩 大模型本身这一层封装了海量算力 大语言模型不仅仅是权重的变大,通过推理技术,表达了更庞大算力...
充分利用算力的精度
我们都知道现在的深度神经网络有大量的信息是冗余的,利用这个冗余进行提高效率的计数有,稀疏计算、低精度量化等等技术。 乘法本来就是一种数学上的定义,可以理解成一种最简单的信息处理方法、公式 硬件实现FP32单元实际上是按照数学定义的浮点计算去等价, 神经网络不像科学计算,其在算法设计上就不需要这么高的精度表达 神经网络算法本身就没有办法用到这么高的精度 可以从两个方面来看一下这个问题 硬件为什么FP32就是浪费? 为什么科学计算就是需要FP32甚至是FP64,而神经网络是没有办法?还是没有必要? 再进行一下...
AI底层技术的这几年
开始于卷积神经网络 依稀记得AI框架的鼻祖是caffe 后面的pytorch和tensorflow的出现逐渐把深度神经网络的引用慢慢推向成熟 后面就开始进入到了框架的竞争和底层图编译框架的竞争 tensorflow vs pytorch mlir vs tvm 我们都知道胜者是mlir+pytorch 因为这两个分别代表了两个需求的极致 mlir的在图编译以及不同硬件体系对接上的优势 pytorch在上层易用性上的优势 总结 其实不仅仅是框架的技术路线的竞争,也深深影响了国内AI加速芯...
翻倍的本质
马丁格尔策略(Martingale Strategy),俗称“加倍赌注法”或“倍投法”,是博弈论和金融学中最著名、最古老,但也最危险的资金管理策略之一。 它的基本逻辑非常直观:“只要我无限翻倍,输多少次都能在一把里全部赢回来。” 为什么翻倍这个工具那么的特殊,在很多地方都可以看到?隐隐约约好像代表了一个很复杂的概念,虽然表面上看起来很简单。 翻倍是什么 X2 把过去的历史的一个完全的总结,表达 一笔勾销,我们最后赌一次 指数爆炸,“棋盘上的麦粒”(或“国王与国际棋盘的故事”) 翻倍代表了一种什么样子的机制? ...
人脑-背景思维
当下做主的,是临时判断和情绪 有趣的现象:等红灯的时候,掏出手机看了一眼,发现自己买的股票跌得很厉害,一整片很绿很绿,绿得刺眼。心情一下子起了波动,乱乱的。就在这时,交通灯也变绿了——同样是绿,这一个却是"走",该踩油门了;可内心一阵害怕,手脚发僵,不敢启动车子。 论点:人脑工作的一个有趣机制——当下做决定,占主导的是临时的判断逻辑和情绪 那一刻,理性不在台上:灯绿就走才是理性答案,可人没照它做。 真正当家的是两样东西(还互相喂): 临时的判断逻辑——大脑当场拼出一个"现在很危险",不去核对"股票跟开...
语言模型究竟能记住多少内容?
论文阅读笔记:How much do language models memorize? 论文基本信息: 标题:How much do language models memorize?(语言模型究竟能记住多少内容?) 作者:John X. Morris 等(由 Meta FAIR, Google DeepMind, NVIDIA 等机构的研究人员联合发表) 核心主题:大语言模型(LLM)的记忆容量量化、泛化能力与“顿悟(Grokking)”现象。 1. 研究背景与动机 (Motivation) 核心痛点:在...
智能体编排的目标
目的:写给做 Agent 编排层和 harness 的人,说清楚现在的助手类 Agent 卡在哪里,以及编排层该往哪个方向做。 顶层论点:助手类 Agent 的自洽和逻辑只能维持在当前上下文里,要突破,就得把自洽、记忆和调度移到 LLM 外面的编排层。 只是一个上下文助手:Agent 工程化 当前不管是 Code、Cowork,还是比较火的 OpenClaw,这些助手类的 Agent 不外乎两个特点。 所有的自洽和逻辑都只能维持在当前的上下文 上下文可以被动态的追加、压缩、整理、拼接 外挂一些固定的处理...