Skip to main content
Advanced Search
Search Terms
Content Type

Exact Matches
Tag Searches
Date Options
Updated after
Updated before
Created after
Created before

Search Results

170 total results found

直觉并不落后_合并提纲

基本问题

直觉并不落后 从 AI 的边界,看人的位置 背景:AI 越来越强——能作诗、能生成视频、能写代码,看着像要无所不能。 疑问:可它到底止于哪、为什么?而它够不到的地方,是不是恰恰是人最该站的位置? 论点:直觉与第一性原理不落后,正是人超越「解题机器」的关键 一、AI 是台越来越强的「解题机器」 现在已经成的 作词、作诗 视频生成与修改:关羽弹吉他、名人虚构照片 应用大爆发:编程、问答、领域知识(金融/医疗/法律)、生活服务、信息娱乐、企业加速、科研、工业自动化、教育 还会更强——能力三要素都还有巨大空间 ...

信息压缩-封装算力-技术共识

算法&模型 Transformer

AI的发展实际上是在追求更高的层级的信息压缩 CNN的卷积核是对图像的信息压缩 多层神经网络是在压缩/抽象自然语言表达的语义 从压缩的角度来看,就是用这个模型来压缩真实文本,平均还要花多少bit,才能把下一个token写出来? 不断得更高维度的压缩才是重点 用自然语言来思考是llm这一层的最大作用,自然语言天然就是一个高度压缩的表达方式 推理技术的加成,让自然语言完全发挥,本质上是更高一层维度的抽象/表达/压缩 大模型本身这一层封装了海量算力 大语言模型不仅仅是权重的变大,通过推理技术,表达了更庞大算力...

充分利用算力的精度

基本问题

我们都知道现在的深度神经网络有大量的信息是冗余的,利用这个冗余进行提高效率的计数有,稀疏计算、低精度量化等等技术。 乘法本来就是一种数学上的定义,可以理解成一种最简单的信息处理方法、公式 硬件实现FP32单元实际上是按照数学定义的浮点计算去等价, 神经网络不像科学计算,其在算法设计上就不需要这么高的精度表达 神经网络算法本身就没有办法用到这么高的精度 可以从两个方面来看一下这个问题 硬件为什么FP32就是浪费? 为什么科学计算就是需要FP32甚至是FP64,而神经网络是没有办法?还是没有必要? 再进行一下...

AI底层技术的这几年

基本问题

开始于卷积神经网络 依稀记得AI框架的鼻祖是caffe 后面的pytorch和tensorflow的出现逐渐把深度神经网络的引用慢慢推向成熟 后面就开始进入到了框架的竞争和底层图编译框架的竞争 tensorflow vs pytorch mlir vs tvm 我们都知道胜者是mlir+pytorch 因为这两个分别代表了两个需求的极致 mlir的在图编译以及不同硬件体系对接上的优势 pytorch在上层易用性上的优势 总结 其实不仅仅是框架的技术路线的竞争,也深深影响了国内AI加速芯...

翻倍的本质

基本问题

马丁格尔策略(Martingale Strategy),俗称“加倍赌注法”或“倍投法”,是博弈论和金融学中最著名、最古老,但也最危险的资金管理策略之一。 它的基本逻辑非常直观:“只要我无限翻倍,输多少次都能在一把里全部赢回来。” 为什么翻倍这个工具那么的特殊,在很多地方都可以看到?隐隐约约好像代表了一个很复杂的概念,虽然表面上看起来很简单。 翻倍是什么 X2 把过去的历史的一个完全的总结,表达 一笔勾销,我们最后赌一次 指数爆炸,“棋盘上的麦粒”(或“国王与国际棋盘的故事”) 翻倍代表了一种什么样子的机制? ...

人脑-背景思维

基本问题

当下做主的,是临时判断和情绪 有趣的现象:等红灯的时候,掏出手机看了一眼,发现自己买的股票跌得很厉害,一整片很绿很绿,绿得刺眼。心情一下子起了波动,乱乱的。就在这时,交通灯也变绿了——同样是绿,这一个却是"走",该踩油门了;可内心一阵害怕,手脚发僵,不敢启动车子。 论点:人脑工作的一个有趣机制——当下做决定,占主导的是临时的判断逻辑和情绪 那一刻,理性不在台上:灯绿就走才是理性答案,可人没照它做。 真正当家的是两样东西(还互相喂): 临时的判断逻辑——大脑当场拼出一个"现在很危险",不去核对"股票跟开...

语言模型究竟能记住多少内容?

AI加速芯片 Binary AI

论文阅读笔记:How much do language models memorize? 论文基本信息: 标题:How much do language models memorize?(语言模型究竟能记住多少内容?) 作者:John X. Morris 等(由 Meta FAIR, Google DeepMind, NVIDIA 等机构的研究人员联合发表) 核心主题:大语言模型(LLM)的记忆容量量化、泛化能力与“顿悟(Grokking)”现象。 1. 研究背景与动机 (Motivation) 核心痛点:在...

智能体编排的目标

算法&模型 智能体

目的:写给做 Agent 编排层和 harness 的人,说清楚现在的助手类 Agent 卡在哪里,以及编排层该往哪个方向做。 顶层论点:助手类 Agent 的自洽和逻辑只能维持在当前上下文里,要突破,就得把自洽、记忆和调度移到 LLM 外面的编排层。 只是一个上下文助手:Agent 工程化 当前不管是 Code、Cowork,还是比较火的 OpenClaw,这些助手类的 Agent 不外乎两个特点。 所有的自洽和逻辑都只能维持在当前的上下文 上下文可以被动态的追加、压缩、整理、拼接 外挂一些固定的处理...