transformer面试经验
简述Transfomer的嵌入层(Embedding Layer)嵌入层作为transformer的输入层,主要是将输入的 Token 转换为连续的向量表示,主要包括词嵌入和位置编码两个部分。 1.词嵌入(Word Embedding)词嵌入是将输入序列中的每个token映射到一个高维嵌入向量。这些向量能够捕捉到词与词之间的语义关系。 词嵌入的过程是:(1)初始化一个嵌入矩阵,其行数等于词汇表大小V,列数为嵌入维度d;(2)通过词汇表得到输入文本中每个token对应的索引;(3)以索引为行数,直接从嵌入矩阵里取出对应的那一行向量,这行向量就成了该 token的嵌入向量。 2.位置编码(Positional Encoding)由于 Transformer 是基于自注意力机制的,它没有内建的顺序信息。为了解决这个问题,Transformer 添加了位置编码(Positional...
transformer面试经验2
详细描述一下transformer⭐⭐⭐⭐⭐Transformer是2017年Google团队在论文《Attention Is All You Need》中提出的深度学习模型,彻底改变了自然语言处理(NLP)领域的范式。它完全基于自注意力机制(Self-Attention),替代了此前主流的 RNN/LSTM 等循环神经网络,解决了循环模型的两大痛点:并行计算能力弱(RNN需按序列顺序处理,无法并行)和长距离依赖捕捉能力有限(依赖序列长度累积信息,长文本中衰减严重)。目前,几乎所有主流预训练模型(如BERT、GPT、llama等)均以Transformer为基础,成为 NLP 领域(如机器翻译、文本生成)乃至多模态任务(如图文理解)的基础架构。 Transformer的整体结构Transformer由Encoder(编码器) 和Decoder(解码器) 两部分组成: Encoder:编码器接收源序列,输出编码特征(Encoder Output),用于捕捉源序列的全局语义; ...
无标题
大模型优化技术大模型推理优化技术-KV Cache大模型显存优化技术-PagedAttention大模型优化技术-FlashAttention大模型推理优化技术-Flash-Decoding大模型显存优化技术-ZeRO系列大模型解码优化-Speculative Decoding及其变体大模型推理服务请求调度优化技术-Continuous batching 大模型优化算法是提升模型推理效率、降低计算资源消耗的关键技术,以下从KV-Cache原理、常见优化算法及应用场景三方面展开解析: 一、KV-Cache:大模型推理的核心加速技术1. 基本概念与原理 定义:KV-Cache(Key-Value...
无标题
1.ThreadsPerBlock和Blocks的数量受哪些条件约束。2.理论占用率怎么计算?3.什么是warp,什么是warp divergence?4.cuda的内存模型里有多少种memory,它们的位置(片上还是板上),带宽和延迟的相对大小?5.global memory的访存合并是什么?6.什么样的变量会被分配在register上?什么样的变量会被分配在local memory上?7.Block是怎么被SM调度执行的?8.什么是cuda core? 什么是tensor core?9.什么是bank confict+?怎么避免bank confict,你能想到多少方法?10.描述-下Block reduce的大致实现。11.描述-下double buffer(ping pong buffer)的大概原理和实现。12.什么是roofline model?什么是memory bound,什么是computation bound?13.kernel...
无标题
4.5.1 Qwen14.5.2 Qwen2
无标题
4.6.1 Deepseek-V14.6.2 Deepseek-V24.6.3 Deepseek-R1
无标题
1.1.1分词介绍1.1.2 分词算法1.1.3 常用分词库1.1.4 分词方法对比
无标题
1.2.1 词嵌入介绍1.2.2 词嵌入方法









