llava源码精读 Llava的结构 LLava的架构很简单就是在LLM的前面挂一个视觉encoder,这个encoder是预训练过的,LLava是用的CLIP的视觉encoder,但这里不是得到一个最终的图片向量,而是一个更细粒度的图片patch_token向量,然后再过一个P…
|
34
|
|
2220 字
|
16 分钟
RELU到SwiGLU:LLM中FFN层的演变 原始transformer的FFN层 原始transformerFFN层非常简单,就是一个升维+降维的操作,中间套一个RELU激活函数: FFN层的作用是增加模型的非线性能力,升维再降维的操作也是老传统了,之前学从感知机到多层感知机就明白,一个低的维度的特征终…
|
55
|
|
1029 字
|
5 分钟
MHA、MQA、GQA小结 多头注意力(Multi-head Attention,MHA) 原始transformer架构的多头注意力是将QKV拆成多个头,对于(batch_size,seq_len,d_model)维度的QKV向量拆成:(batch_size,seq_len,head_…
|
55
|
|
1164 字
|
9 分钟
从 LayerNorm 到 RMSNorm:为什么可以去掉均值? 在现代 LLM 中,RMSNorm 已经成为非常常见的归一化方式。它可以看作是 LayerNorm 的一个简化版本。 要理解 RMSNorm,最自然的方式是先从 LayerNorm 开始。 1. LayerNorm 在做什么? 对于一个 hidden stat…
|
68
|
|
1083 字
|
5 分钟
CLIP、SigLIP、SigLIP2小结 写在前面:这个文章是我快速回顾这些知识点的输出,出发点并不是写一个易懂的知识博客,读者多多包涵。 CLIP CLIP的结构非常简单,输入端是图文对,训练数据中的图文对是具有强相关的,即文本就是图片的描述。 然后图片和文本都会经过一个编特征提取器,一般图片是用R…
|
55
|
|
2956 字
|
16 分钟
由Sinusoidal位置编码到RoPE 前言 请打开日间模式进行阅读 本来是想学习RoPE(旋转位置编码),所以回去从头从最开始的三角函数式位置编码开始看,发现自己当时学的还是浅了。在此总结一下。 注:本文涵盖不了所有位置编码,只挑主流的去学习。具体就是由绝对位置编码到相对位置编码再到RoPE 三角…
|
1,066
|
|
3518 字
|
14 分钟
LoRA小结 前言:PEFT的诞生 传统的预训练-下游任务微调的范式,是对预训练模型所有参数进行微调,即全量微调。之前基于Bert、GPT1的下游微调任务都是这么干的。因为当时的预训练模型参数量比较少,所以速度并没有那么慢。…
|
1,239
|
|
2674 字
|
11 分钟
计算机网络学习笔记:第六章 应用层 6.1 应用层概述 应用层是计算机网络体系结构的最顶层,是设计和建立计算机网络的最终目的,也是计算机网络中发展最快的部分。 6.2 C/S模式与P2P模式 客户/服务器 (Client/Server,C/S)方式 对等(Peer-to-Peer,P2P)方式 …
|
3,671
|
|
719 字
|
3 分钟
计算机网络学习笔记:第五章 运输层 5.1运输层概述 运输层直接为应用进程间的逻辑通信提供服务 计算机网络体系结构中的物理层、数据链路层以及网络层它们共同解决了将主机通过异构网络互联起来所面临的问题,实现了主机到主机的通信。 但实际上进行通信的是位于通信两端主机的进程 如何为运行在不同主机上的应…
|
3,645
|
|
2665 字
|
11 分钟
计算机网络学习笔记:第四章 网络层 4.1 网络层概述 4.2 网络层的两个层面(两种服务) 面向连接的虚电路服务 无连接的数据报服务 两种服务的比较 4.3 IPv4地址 4.3.1 概述 对于主机和路由来说,IP地址都是32位的二进制代码,为了方便表示,我们在每8位之间插入一个空格,为了方便…
|
3,561
|
|
6155 字
|
24 分钟