text2SQL
在智能体业务场景中,“让 Agent 直接生成 SQL 去查库"几乎是每个人最先想到的做法——它简单、直接,不需要任何额外建设。但在实际项目中,并不建议这么做:模型生成的 SQL 常常"看着对、实际错”,幻觉会编造不存在的表和字段,超长上下文会稀释模型的注意力,业务口径不清则会产生语法完全正确、数字却错误的查询结果,而这类错误恰恰最难被察觉。那么,不直接生成 SQL,还有什么更可靠的做法?本文从这…
在智能体业务场景中,“让 Agent 直接生成 SQL 去查库"几乎是每个人最先想到的做法——它简单、直接,不需要任何额外建设。但在实际项目中,并不建议这么做:模型生成的 SQL 常常"看着对、实际错”,幻觉会编造不存在的表和字段,超长上下文会稀释模型的注意力,业务口径不清则会产生语法完全正确、数字却错误的查询结果,而这类错误恰恰最难被察觉。那么,不直接生成 SQL,还有什么更可靠的做法?本文从这…
最近开源的 Kimi K3 的出色表现让不少人惊叹,大家想必也很好奇它到底做了什么才能有这样的效果。最近我翻阅了 Kimi K3 的技术报告,其中架构上的创新点主要是:Attention Residuals、KDA(Kimi Delta Attention)、LatentMoE,以及 MXFP4/MXFP8 量化训练这四个。
这篇文章,我们就来好好聊聊其中的 Attention Residuals。
在 RAG 系统中,Reranker 往往是决定最终检索质量的关键一环,却也是最容易被忽视的模块。本文从 Reranker 的基本原理出发,介绍 Reranker Encoder 和 Decoder 两类架构的工作机制,随后解析目前中文场景下最主流的两大模型系列BGE-Reranker 与 Qwen3-Reranker的模型设计与训练策略,最后结合实测数据给出实际选…
Hyper Connections 是对残差网络(Residual Connections) 的一种改进设计,其核心在于引入了可学习的深度连接与宽度连接。该方法在几乎不增加计算量和参数量的前提下,能够带来显著的性能提升,且具有极高的普适性——无论是密集连接(Dense)还是混合专家模型(MoE),无论是视觉任务还是文本模态,均能取得收益。特别是在大语言模型(LLMs)的预训练中,收敛速度最高可提升0.8倍[1]。
在使用 RAG(Retrieval-Augmented Generation)时,我们通常需要在大量文本向量中,找到与查询最相似的若干条语句。最直观的方式是对所有向量逐一计算相似度(余弦相似度、欧氏距离等),然后进行比较。在数据规模较小时,这种方法尚可接受;但当数据量达到百万甚至更高量级时,逐一匹配将带来巨大的时间开销。
RoPE(旋转位置编码)是一种结合了绝对位置编码和相对位置编码的一种编码方法,出自苏剑林老师提出的RoFormer,现如今已经作为LLM结构的标配了,可见其效果强大。这篇文章就来具体解析一下,RoPE的原理和优势到底是什么。
MOE(Mixture of Experts)也就是混合专家系统,已经在LLM(Large Language Model)的结构中成为标配了。最近看到一篇手写MOE教程,所学下来,受益颇多。
想要大模型在通用性上获得更好的效果,就需要让大模型对更多的领域知识进行“补充”。
《Do Large Language Models Need a Content Delivery Network》论文提出了 KDN(Knowledge Delivery Network),简单来说就是对输入进行“缓存”,从而提升模型首个 Token 响应时间,并将 KDN 开源为 LMCache
Function Calling 和 MCP 通过一组外部工具,帮助 LLM 获取其无法直接知晓的信息或者难以执行的操作。本文分别对他们进行说明,并对比异同
KV Cache是一种针对Transformer-Decoder部分的注意力层的优化技术,其原理是通过缓存之前生成的KV值,提高模型的推理性能。