<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>博客 on 南巷</title><link>https://nx.wmlab.top/categories/%E5%8D%9A%E5%AE%A2/</link><description>Recent content in 博客 on 南巷</description><generator>Hugo -- gohugo.io</generator><language>zh-CN</language><managingEditor>liuwenhao1968@163.com (南巷)</managingEditor><webMaster>liuwenhao1968@163.com (南巷)</webMaster><copyright>© 2026 南巷</copyright><lastBuildDate>Mon, 15 Jun 2026 02:14:39 +0800</lastBuildDate><atom:link href="https://nx.wmlab.top/categories/%E5%8D%9A%E5%AE%A2/index.xml" rel="self" type="application/rss+xml"/><item><title>ViT</title><link>https://nx.wmlab.top/blog/vit/</link><pubDate>Mon, 15 Jun 2026 02:14:39 +0800</pubDate><author>liuwenhao1968@163.com (南巷)</author><guid>https://nx.wmlab.top/blog/vit/</guid><description>下面详细分析一下ViT，这个开启了cv的新时代。在cnn处理不好的地方，在vit却是可以很好的处理。</description></item><item><title>SegFormer</title><link>https://nx.wmlab.top/blog/segformer/</link><pubDate>Mon, 15 Jun 2026 02:14:35 +0800</pubDate><author>liuwenhao1968@163.com (南巷)</author><guid>https://nx.wmlab.top/blog/segformer/</guid><description>提出一个层级（多尺度）且不依赖位置编码的 Transformer 编码器（MiT），可以直接输出多尺度特征（1/4、1/8、1/16、1/32），避免了 ViT 在不同测试分辨率下必须插值位置编码带来的性能下降。</description></item><item><title>Swin Transformer</title><link>https://nx.wmlab.top/blog/swin-transformer/</link><pubDate>Mon, 15 Jun 2026 02:14:32 +0800</pubDate><author>liuwenhao1968@163.com (南巷)</author><guid>https://nx.wmlab.top/blog/swin-transformer/</guid><description>Patch 分割和线性嵌入 \(Patch Partition + Linear Embedding\)</description></item><item><title>MaskFormer</title><link>https://nx.wmlab.top/blog/maskformer/</link><pubDate>Mon, 15 Jun 2026 02:14:28 +0800</pubDate><author>liuwenhao1968@163.com (南巷)</author><guid>https://nx.wmlab.top/blog/maskformer/</guid><description>具体表现：</description></item><item><title>Mask2Former</title><link>https://nx.wmlab.top/blog/mask2former/</link><pubDate>Mon, 15 Jun 2026 02:14:20 +0800</pubDate><author>liuwenhao1968@163.com (南巷)</author><guid>https://nx.wmlab.top/blog/mask2former/</guid><description>MaskFormer 让分割任务变成 “预测一组掩码 + 类别”； Mask2Former 让模型 “只看自己负责的掩码区域，更聪明地预测掩码”。</description></item><item><title>DINO</title><link>https://nx.wmlab.top/blog/dino/</link><pubDate>Mon, 15 Jun 2026 02:14:13 +0800</pubDate><author>liuwenhao1968@163.com (南巷)</author><guid>https://nx.wmlab.top/blog/dino/</guid><description>在 DINO 出现之前，自监督视觉表示学习主要有两类主流方法：</description></item><item><title>SAM</title><link>https://nx.wmlab.top/blog/sam/</link><pubDate>Mon, 15 Jun 2026 02:14:12 +0800</pubDate><author>liuwenhao1968@163.com (南巷)</author><guid>https://nx.wmlab.top/blog/sam/</guid><description>sam设计的出发点：</description></item><item><title>DETR</title><link>https://nx.wmlab.top/blog/detr/</link><pubDate>Mon, 15 Jun 2026 02:14:04 +0800</pubDate><author>liuwenhao1968@163.com (南巷)</author><guid>https://nx.wmlab.top/blog/detr/</guid><description>在做DETR之前，目标检测都是下面两种任务方式：</description></item><item><title>Deformable DETR</title><link>https://nx.wmlab.top/blog/deformable-detr/</link><pubDate>Mon, 15 Jun 2026 02:14:02 +0800</pubDate><author>liuwenhao1968@163.com (南巷)</author><guid>https://nx.wmlab.top/blog/deformable-detr/</guid><description>原来大DETR有几个缺点：</description></item><item><title>Flow Matching</title><link>https://nx.wmlab.top/blog/flow-matching/</link><pubDate>Sun, 14 Jun 2026 19:06:46 +0800</pubDate><author>liuwenhao1968@163.com (南巷)</author><guid>https://nx.wmlab.top/blog/flow-matching/</guid><description>从 Diffusion 的加噪、去噪与监督目标出发，逐步理解 Flow Matching 如何学习从噪声到数据的连续流场。</description></item><item><title>智元 GO-1 / AgiBot World GO-1</title><link>https://nx.wmlab.top/blog/agibot-world-go1/</link><pubDate>Sun, 14 Jun 2026 19:06:13 +0800</pubDate><author>liuwenhao1968@163.com (南巷)</author><guid>https://nx.wmlab.top/blog/agibot-world-go1/</guid><description>拆解 AgiBot World 与 GO-1 的平台、数据和模型设计，重点关注理解-规划-执行分层结构、Latent Planner 与 Action Expert 的实现路径。</description></item><item><title>ACoT-VLA</title><link>https://nx.wmlab.top/blog/acot-vla/</link><pubDate>Sun, 14 Jun 2026 19:06:05 +0800</pubDate><author>liuwenhao1968@163.com (南巷)</author><guid>https://nx.wmlab.top/blog/acot-vla/</guid><description>围绕 ACoT-VLA 的背景、模型架构、显式/隐式动作推理与动作引导预测，梳理 VLA 中语义理解到低层动作控制的过渡设计。</description></item><item><title>LLaMA 2 SFT 监督微调</title><link>https://nx.wmlab.top/blog/llama2-sft-supervised-finetuning/</link><pubDate>Sun, 14 Jun 2026 17:52:56 +0800</pubDate><author>liuwenhao1968@163.com (南巷)</author><guid>https://nx.wmlab.top/blog/llama2-sft-supervised-finetuning/</guid><description>系统整理 SFT 监督微调的目标、数据格式、训练方式与代码流程，帮助模型从通用能力走向任务对齐。</description></item><item><title>LLaMA 2 预训练流程</title><link>https://nx.wmlab.top/blog/llama2-pretraining-process/</link><pubDate>Sun, 14 Jun 2026 17:52:46 +0800</pubDate><author>liuwenhao1968@163.com (南巷)</author><guid>https://nx.wmlab.top/blog/llama2-pretraining-process/</guid><description>从数据集构建、样本切分、词表处理、模型输入到训练循环，梳理 LLaMA 2 预训练的核心流程。</description></item><item><title>LLaMA 2 动手实现</title><link>https://nx.wmlab.top/blog/llama2-hands-on-implementation/</link><pubDate>Sun, 14 Jun 2026 17:52:34 +0800</pubDate><author>liuwenhao1968@163.com (南巷)</author><guid>https://nx.wmlab.top/blog/llama2-hands-on-implementation/</guid><description>围绕 LLaMA 2 的数据集、Tokenizer、模型结构与训练代码，记录从原理拆解到工程实现的完整实践过程。</description></item><item><title>LLaMA 2 解析</title><link>https://nx.wmlab.top/blog/llama2-analysis/</link><pubDate>Sun, 14 Jun 2026 17:49:58 +0800</pubDate><author>liuwenhao1968@163.com (南巷)</author><guid>https://nx.wmlab.top/blog/llama2-analysis/</guid><description>从模型架构、Tokenizer、RMSNorm、GQA、RoPE、FFN 到输出层，系统拆解 LLaMA 2 的核心组件与设计动机。</description></item></channel></rss>