首页 > 专栏 > 土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 共 782 条资讯 【图数据库内核】全文与向量属性边界:Lucene 旁路,不是 page cache 里的第二套邻接 【图数据库内核】TinkerPop / JanusGraph:外置邻接表图层,不是第二套原生 store 图数据库内核 — 系列规划 【存储工程】对象存储性能工程 【Transformer 与注意力机制】56|状态空间模型:Mamba、S4 的线性复杂度路径 【Transformer 与注意力机制】58|后 Transformer 时代:架构会消失还是会进化 【Transformer 与注意力机制】57|RWKV / RetNet / 线性注意力:各种降低复杂度的探索 【Transformer 与注意力机制】49|KV Cache:推理为什么是 O(n) 不是 O(n²) 【Transformer 与注意力机制】38|GPT 系列:从 GPT-1 到 GPT-4 的路线演进 【Transformer 与注意力机制】43|稀疏与局部注意力:Longformer、BigBird、Sparse Transformer 【Transformer 与注意力机制】48|从 logits 到文本:解码策略是决策层,不是收尾细节 【Transformer 与注意力机制】50|Speculative Decoding:用小模型加速大模型 【Transformer 与注意力机制】51|量化、蒸馏、剪枝:压缩改变的是三种不同的东西 【Transformer 与注意力机制】52|可解释性入门:注意力权重真的是“解释”吗 【Transformer 与注意力机制】54|涌现能力:规模效应、评测假象与可预测性之争 【Transformer 与注意力机制】39|T5:把所有 NLP 任务塞进 Text-to-Text,代价在哪里 【Transformer 与注意力机制】53|机制可解释性:电路、诱导头与叠加态的边界 【Transformer 与注意力机制】41|位置编码演进:从 Sinusoidal 到 RoPE、ALiBi 与长度外推的边界 【Transformer 与注意力机制】44|MoE:稀疏激活的万亿模型路径 【Transformer 与注意力机制】40|三大路线之争:为什么大模型几乎都是 Decoder-only « 上一页1…1718192021…40下一页 » 相关分类 #!/slash/note #UNTAG (B)(F)uzzing on my world (Hi)story (IN)SECURE Magazine Notification (gdb) break *0x972 - 带鱼博客 BeltfishBlog - ./kwaa.dev .NET Blog .Trash /home/rook1e 00's Adventure 0kami's Blog 0x41414141 in ?? () 0x7f Blog 0xRick Owned Root ! 0xd00's blog 1 Byte 1A23 Blog 1A23 Studio 1Link.Fun 1stwebdesigner 251 2BAB 的工程博客 2ch中文网 360 CERT 360 Netlab Blog - Network Securi 38号车评中心 3o米的微博 404 Media