Skip to main content

Recently Updated Pages

AI大行其道,谁最得利?

基本问题

当前,AI已成为工程师的“能力倍增器”,10倍工程师变成行业的新底线。这导致行业对工程师的要求发生了根本性转变:几乎要求每位工程师都具备架构师的思维与视野。 这种变化带来了双重影响: 对资深工...

Updated 4 months ago by Colin

AI的效果悖论_骗局

基本问题

AI的效果悖论/骗局 现象 看起来现在的大模型已经无所不能,LLM的语言能力,nano banana的图像,Sora的视频等等 能生成几乎是任意的数字内容,其实在早几年的CV(卷积网络)时代就已...

Updated 4 months ago by Colin

主流的产品

AI加速芯片 边缘推理芯片

高通® QCS6490 https://docs.radxa.com/dragon/q6a 全志 A733 SoC https://docs.radxa.com/cubie/a7a ...

Updated 4 months ago by Colin

LLM跑在边缘芯片上

AI加速芯片 边缘推理芯片

模型工具,转换,加载等等 Distributed Llama https://github.com/b4rtaz/distributed-llama?tab=readme-ov-file ...

Updated 4 months ago by Colin

为什么Pytorch开始制约AI了

AI加速芯片 软件框架

这个想法比较超前了,但是已经有苗头了 pytorch已经显得臃肿,不适合大模型的特定需求 需求变化了,已经不是CNN的时代了,虽然在拼命搞静态图和并行库 一个开源框架统一市场后一段时间,就会...

Updated 4 months ago by Colin

建模的方法

AI加速芯片 仿真建模

使用python语法进行module的定义 python语法用来描述module之间的关系和 定义latch的存储器 定义module的算法和输入输出 配置一些固定的规格参数 针对throu...

Updated 4 months ago by Colin

Sync And Async

AI加速芯片 GMP

面临的问题 多种类型的硬件单元需要进行同步 不确定的循环次数 N to N的同步需求 无缝的同步,无缝的并行 频繁的同步需求,频繁的状态pulling,低latency 灵活的抽象适应所有的同...

Updated 4 months ago by Colin

架构_微架构

AI加速芯片 GMP

架构/微架构 设计 标量寄存器和向量寄存器统一,支持自动进行转换 异步单元(SP-PU-L1-DMA)之间都采用异步机制,依赖转移到异步目标 统一的同步机制 静态分配同步资源 原生软硬件支持...

Updated 4 months ago by Colin

AI加速芯片上的2D单元

AI加速芯片 GMP

卷积天然的数据复用度是Dot的9倍,对于芯片的压力更小 算力缩放是一个非常重要的问题,涉及架构各代之间的稳定性,保护客户的价值 L1/L2/L0 怎么支持reshape或者swizzel 不同...

Updated 4 months ago by Colin

二值 二进制 Binary 神经网络算法

AI加速芯片 Binary AI

背景 FPGA的基本单元是LUT(查找表),如果把LUT看成一种逻辑运算单元 查找表的真值表可以表示静态权重 查找表的部份输入表示动态权重 FPGA的可重构特性,相对于AI处理器 可以...

Updated 4 months ago by Colin

先量化 再训练

AI加速芯片 Binary AI

量化主流的LLM到Binary Lut可以进行编码压缩,降低存储需求 实际数据touch不到的选择项可以被去除 调整顺序,编码,进行无损Lut表压缩 原生的训练Bianry模型 非梯...

Updated 4 months ago by Colin

硬件开发及仿真工具

AI加速芯片

LogicSIM生成RTL 时间定义只对reg有作用 同一时间reg只能被一个信号写 logic数据要存到reg才能继续被下一次使用 reg只有在clk(统一的时钟)的上升沿才会被触发写 lo...

Updated 4 months ago by Colin

主流推理小芯片

AI加速芯片

NVIDIA Jetson Orin HAILO Hailo-8 15 等等 domain-specific-dataflow-processing 据悉,它能够在功耗低于5W的情况下...

Updated 4 months ago by Colin

电路(硬件微架构)的难点和优势

AI加速芯片

难点、不适合 难以做复杂的算法(调度、分析、统计) 难以做逻辑深度比较深的计算 latency的长和不确定,模块间的时间不确定性 需要大量实现“异步”逻辑 消耗大量的面积 需要很大的b...

Updated 4 months ago by Colin

主流AI加速大芯片

AI加速芯片

NVIDIA Sohu 芯片初创公司Etched近日宣布推出了一款针对 Transformer架构专用的AISC芯片 “Sohu”,并声称其在AI大语言模型(LLM)推理性能方面击败了NVI...

Updated 4 months ago by Colin

SIMT With Vector

AI加速芯片

DMA 2D算力的表达和设计 微架构和ISA的配合,软件控制流水线,硬件hzd检查简单高效 GS和Cache系统的设计 左右支的复用 RO WO 存储类型的利用 [![image.pn...

Updated 4 months ago by Colin

Reduce的并行加速

AI加速芯片

CUDA 1. 采用Divergence的支持和Block同步来支持 2. 其他的深度优化:https://developer.download.nvidia.com/assets/cuda/...

Updated 4 months ago by Colin

Open GPGPU

AI加速芯片

Ventus GitHub - THU-DSP-LAB/ventus-gpgpu: GPGPU processor supporting RISCV-V extension, developed...

Updated 4 months ago by Colin

Cuda Tensor Core

AI加速芯片

要保持张量核心持续运行并不容易。 研究人员发现GPU硬件具有一些特性,对于保持矩阵乘法的运行非常重要: WGMMA指令虽然是必要的,但使用起来颇为麻烦。 共享内存的速度并不如预期的快,使用时还...

Updated 4 months ago by Colin

LLM时代AI加速芯片面临的挑战

AI加速芯片

算法需求 普遍使用MOE架构降低算力需求 高度定制化的集成度高的大算子 定制化的核心Attention加速算子:FlashAttention KVcache的压缩、加速等: Deepse...

Updated 4 months ago by Colin