实例分割新范式:Falcon Perception技术剖析学习分享这篇文章讨论的是一个很有意思的问题:dense perception任务是否一定需要encoder-decoder结构? 目前开放词汇检测、promptable segmentation、OCR这类任务,常见做法大概是: • 先用一个vision backbone提取图像features • 单独的 decoder 或 late-fusion module 将这些 features 转换为任务输出 虽然上面的范式在业内已经验证了有效性,但它的问题也很明显。模块越多,视觉语言的交互较晚,并且系统的复杂度也会更高。 针对dense perception的任务特点,作者提出以下关键设计:1)Unified Dense Transformer with Hybrid Attention Mask; 2)Chain-of-Perception; 3)Specialized heads2026-5-30 多模态 图像分割
LocateAnything技术小结学习分享LocateAnything讨论的是一个用AR的思路做检测的痛点:VLM做grounding / detection时,bbox是否一定要逐token自回归生成?2026-6-24 目标检测 多模态
《Unlimited OCR》技术小结:用R-SWA实现长程文档解析学习分享Unlimited OCR 是基于 DeepSeek OCR 改造的端到端多页 OCR 模型,核心是用 R-SWA 替换 decoder 中的 full attention,使视觉 tokens、prompt 全局可见,而生成历史只保留最近窗口,从而在多页 PDF OCR 中保持恒定 decode-side KV cache,实现更高效的 long-horizon parsing。2026-6-29 ocr 多模态
Kimi K3 技术解析学习分享Kimi K3 的主要设计可以归纳为下面几项: 模型架构层面: • backbone 按 3:1 混合 KDA 与 MLA,兼顾长序列成本和周期性全局交互; • Attention Residuals 缩短 features 沿网络深度的访问路径; • Stable LatentMoE 使用 896 个 routed experts,配合 SiTU-GLU、RMSNorm 和 Quantile Balancing 稳定训练; • MoonViT-V2 从头参与 next-token training,图片、视频和文本使用同一 backbone; 训练&infra • context 按 8K、64K、256K、1M 四个阶段扩展; • post-training 在三个 domain、三个 reasoning-effort 档位上训练 9 个 teachers,再通过 MOPD 合并; • KCP、MoonEP、external KV cache、AgentENV 和 hybrid prefix cache 共同支撑训练与 serving。2026-8-3 大模型 多模态
Step by Step: Understanding ROPE学习分享ROPE是目前不论LLM还是VLLM常用的位置编码。本文将step by step梳理个人对ROPE的理解2025-12-23 大模型 多模态