<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
    <channel>
        <title>LLM on 火炬树</title>
        <link>https://torchtree.com/tags/llm/</link>
        <description>Recent content in LLM on 火炬树</description>
        <generator>Hugo -- gohugo.io</generator>
        <language>zh-cn</language>
        <copyright>TorchTree Co., Ltd.</copyright>
        <lastBuildDate>Sun, 26 Apr 2026 09:16:27 +0800</lastBuildDate><atom:link href="https://torchtree.com/tags/llm/index.xml" rel="self" type="application/rss+xml" /><item>
        <title>撼动 Nvidia CUDA？Intel Arc Pro B70 本地推理调研</title>
        <link>https://torchtree.com/post/intel-arc-pro-b70-llm/</link>
        <pubDate>Sun, 26 Apr 2026 09:16:27 +0800</pubDate>
        
        <guid>https://torchtree.com/post/intel-arc-pro-b70-llm/</guid>
        <description>&lt;p&gt;一条社交媒体帖子将 Intel Arc Pro B70 描述为&amp;quot;以更低价格实现本地推理高性价比&amp;quot;的选项，并认为在 AI 辅助编程和开源社区优化的推动下，Intel 与 NVIDIA CUDA 生态的差距正在缩小。本文基于社区实测数据、技术评测与官方资料，对该观点涉及的事实进行梳理。&lt;/p&gt;
&lt;h2 id=&#34;一硬件规格与定价&#34;&gt;一、硬件规格与定价
&lt;/h2&gt;&lt;p&gt;Intel Arc Pro B70 于 2026 年 3 月发布，基于 Battlemage G31 架构。&lt;/p&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th&gt;规格项&lt;/th&gt;
          &lt;th&gt;数值&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td&gt;Xe Core 数量&lt;/td&gt;
          &lt;td&gt;32&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;显存&lt;/td&gt;
          &lt;td&gt;32 GB GDDR6&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;显存位宽&lt;/td&gt;
          &lt;td&gt;256-bit&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;显存带宽&lt;/td&gt;
          &lt;td&gt;608 GB/s&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;TBP（整卡功耗）&lt;/td&gt;
          &lt;td&gt;230 W&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;供电接口&lt;/td&gt;
          &lt;td&gt;单 8-pin PCIe&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;官方建议零售价&lt;/td&gt;
          &lt;td&gt;949 美元&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;国内渠道方面，蓝戟（GUNNIR）版 Arc Pro B70 TF 32G 在京东等平台的标价约为 6,540 元至 10,000 元人民币不等。&lt;a class=&#34;link&#34; href=&#34;https://post.smzdm.com/p/apq82nd0/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;什么值得买报道&lt;/a&gt;&lt;/p&gt;
&lt;h2 id=&#34;二llm-推理性能实测数据&#34;&gt;二、LLM 推理性能实测数据
&lt;/h2&gt;&lt;h3 id=&#34;21-单卡性能&#34;&gt;2.1 单卡性能
&lt;/h3&gt;&lt;p&gt;Phoronix 于 2026 年 4 月发布了 Arc Pro B70 的 Linux 平台初步评测，测试环境为 Ubuntu 26.04、Linux 7.0 内核、Mesa 26.0 驱动，搭配 Ryzen Threadripper 9980X 工作站。&lt;a class=&#34;link&#34; href=&#34;https://www.phoronix.com/review/intel-arc-pro-b70-linux&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Phoronix 评测&lt;/a&gt;&lt;/p&gt;
&lt;p&gt;GitHub 用户 PMZFX 发布了更详细的单卡与双卡实测数据，测试基于 llama.cpp SYCL + Vulkan 后端以及 vLLM XPU 后端。&lt;a class=&#34;link&#34; href=&#34;https://github.com/PMZFX/intel-arc-pro-b70-benchmarks&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;GitHub 基准数据&lt;/a&gt;&lt;/p&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th&gt;模型&lt;/th&gt;
          &lt;th&gt;类型&lt;/th&gt;
          &lt;th&gt;量化&lt;/th&gt;
          &lt;th&gt;显存占用&lt;/th&gt;
          &lt;th&gt;GPU 数量&lt;/th&gt;
          &lt;th&gt;预填充速度 (pp512)&lt;/th&gt;
          &lt;th&gt;生成速度 (tg128)&lt;/th&gt;
          &lt;th&gt;平均功耗&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td&gt;Llama 3.1-8B Instruct&lt;/td&gt;
          &lt;td&gt;Dense&lt;/td&gt;
          &lt;td&gt;Q4_K_M&lt;/td&gt;
          &lt;td&gt;4.6 GiB&lt;/td&gt;
          &lt;td&gt;1&lt;/td&gt;
          &lt;td&gt;2,452 t/s&lt;/td&gt;
          &lt;td&gt;82.6 t/s&lt;/td&gt;
          &lt;td&gt;37 W&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;Qwen 3.6-35B-A3B&lt;/td&gt;
          &lt;td&gt;MoE&lt;/td&gt;
          &lt;td&gt;UD-Q4_K_M&lt;/td&gt;
          &lt;td&gt;20.6 GiB&lt;/td&gt;
          &lt;td&gt;1&lt;/td&gt;
          &lt;td&gt;615 t/s&lt;/td&gt;
          &lt;td&gt;54.7 t/s&lt;/td&gt;
          &lt;td&gt;114 W&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;Qwen 3.5-35B-A3B&lt;/td&gt;
          &lt;td&gt;MoE&lt;/td&gt;
          &lt;td&gt;Q4_K_M&lt;/td&gt;
          &lt;td&gt;20.5 GiB&lt;/td&gt;
          &lt;td&gt;1&lt;/td&gt;
          &lt;td&gt;618 t/s&lt;/td&gt;
          &lt;td&gt;54.5 t/s&lt;/td&gt;
          &lt;td&gt;92 W&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;Gemma 4 26B-A4B&lt;/td&gt;
          &lt;td&gt;MoE&lt;/td&gt;
          &lt;td&gt;Q4_K_M&lt;/td&gt;
          &lt;td&gt;15.7 GiB&lt;/td&gt;
          &lt;td&gt;1&lt;/td&gt;
          &lt;td&gt;1,129 t/s&lt;/td&gt;
          &lt;td&gt;52.6 t/s&lt;/td&gt;
          &lt;td&gt;102 W&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;h3 id=&#34;22-双卡性能&#34;&gt;2.2 双卡性能
&lt;/h3&gt;&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th&gt;模型&lt;/th&gt;
          &lt;th&gt;类型&lt;/th&gt;
          &lt;th&gt;量化&lt;/th&gt;
          &lt;th&gt;显存占用&lt;/th&gt;
          &lt;th&gt;GPU 数量&lt;/th&gt;
          &lt;th&gt;预填充速度 (pp512)&lt;/th&gt;
          &lt;th&gt;生成速度 (tg128)&lt;/th&gt;
          &lt;th&gt;平均功耗&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td&gt;Qwen3-Coder-Next 80B-A3B&lt;/td&gt;
          &lt;td&gt;MoE&lt;/td&gt;
          &lt;td&gt;Q4_K_M&lt;/td&gt;
          &lt;td&gt;45.1 GiB&lt;/td&gt;
          &lt;td&gt;2&lt;/td&gt;
          &lt;td&gt;305 t/s&lt;/td&gt;
          &lt;td&gt;43.4 t/s&lt;/td&gt;
          &lt;td&gt;79 W&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;DeepSeek-R1-Distill-Llama-70B&lt;/td&gt;
          &lt;td&gt;Dense&lt;/td&gt;
          &lt;td&gt;Q4_K_M&lt;/td&gt;
          &lt;td&gt;39.6 GiB&lt;/td&gt;
          &lt;td&gt;2&lt;/td&gt;
          &lt;td&gt;336 t/s&lt;/td&gt;
          &lt;td&gt;11.5 t/s&lt;/td&gt;
          &lt;td&gt;185 W&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;上述数据表明，MoE（混合专家）模型在 B70 上的能效比（tokens per joule）显著优于同规模 Dense 模型。Qwen 35B-A3B MoE 单卡可达约 54 t/s，而 DeepSeek-R1 70B Dense 双卡仅约 11.5 t/s。&lt;/p&gt;
&lt;h2 id=&#34;三与-nvidia-方案的对比&#34;&gt;三、与 NVIDIA 方案的对比
&lt;/h2&gt;&lt;h3 id=&#34;31-硬件规格对比&#34;&gt;3.1 硬件规格对比
&lt;/h3&gt;&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th&gt;GPU&lt;/th&gt;
          &lt;th&gt;显存&lt;/th&gt;
          &lt;th&gt;显存带宽&lt;/th&gt;
          &lt;th&gt;功耗&lt;/th&gt;
          &lt;th&gt;参考价格&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td&gt;Intel Arc Pro B70&lt;/td&gt;
          &lt;td&gt;32 GB&lt;/td&gt;
          &lt;td&gt;608 GB/s&lt;/td&gt;
          &lt;td&gt;230 W&lt;/td&gt;
          &lt;td&gt;~$949（国内约 6,540–10,000 元）&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;RTX 3090（二手）&lt;/td&gt;
          &lt;td&gt;24 GB&lt;/td&gt;
          &lt;td&gt;936 GB/s&lt;/td&gt;
          &lt;td&gt;350 W&lt;/td&gt;
          &lt;td&gt;~5,200 元（2026 年 4 月二手最低成交价）&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;RTX 5090&lt;/td&gt;
          &lt;td&gt;32 GB&lt;/td&gt;
          &lt;td&gt;1,792 GB/s&lt;/td&gt;
          &lt;td&gt;575 W&lt;/td&gt;
          &lt;td&gt;$2,000+&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;RTX 3090 二手价格方面，据 nickystyle 2026 年 4 月 24 日的二手市场采集数据，RTX 3090 最低成交价为 5,209 元，较此前有所下跌。&lt;a class=&#34;link&#34; href=&#34;https://nickys.cn:5201/?p=137&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;nickystyle 二手显卡价格排行&lt;/a&gt;&lt;/p&gt;
&lt;p&gt;Hardware Corner 的评测指出，B70 的显存带宽约为 RTX 3090 的 65%，这一差距在单流生成场景下构成显著瓶颈。&lt;a class=&#34;link&#34; href=&#34;https://www.hardware-corner.net/intel-arc-b70-llm-gpu-march-31/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Hardware Corner 对比&lt;/a&gt;&lt;/p&gt;
&lt;h3 id=&#34;32-性能对比&#34;&gt;3.2 性能对比
&lt;/h3&gt;&lt;p&gt;Hardware Corner 的单用户推理测试（llama.cpp，Qwen 3.5 27B，4K 上下文，Q4 GGUF）显示：&lt;/p&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th&gt;指标&lt;/th&gt;
          &lt;th&gt;RTX 3090&lt;/th&gt;
          &lt;th&gt;Intel B70（估算）&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td&gt;预填充 (Prefill)&lt;/td&gt;
          &lt;td&gt;1,104 t/s&lt;/td&gt;
          &lt;td&gt;低于 3090&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;生成 (Generation)&lt;/td&gt;
          &lt;td&gt;33 t/s&lt;/td&gt;
          &lt;td&gt;低于 3090&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;该评测同时指出，在批量并发场景下（4x B70 vs 4x RTX 3090，vLLM，Qwen 3.5 27B，50 并发请求），B70 的吞吐量和首 token 延迟与 RTX 3090 处于同一水平甚至略有优势。&lt;/p&gt;
&lt;h2 id=&#34;四软件生态现状&#34;&gt;四、软件生态现状
&lt;/h2&gt;&lt;h3 id=&#34;41-支持的推理框架&#34;&gt;4.1 支持的推理框架
&lt;/h3&gt;&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th&gt;框架/后端&lt;/th&gt;
          &lt;th&gt;支持状态&lt;/th&gt;
          &lt;th&gt;说明&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td&gt;llama.cpp (SYCL)&lt;/td&gt;
          &lt;td&gt;可用&lt;/td&gt;
          &lt;td&gt;性能最优，需手动编译配置&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;llama.cpp (Vulkan)&lt;/td&gt;
          &lt;td&gt;可用&lt;/td&gt;
          &lt;td&gt;Ollama、LM Studio 直接支持，配置最简单&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;IPEX-LLM&lt;/td&gt;
          &lt;td&gt;可用&lt;/td&gt;
          &lt;td&gt;Intel 官方优化，性能较好，配置复杂&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;vLLM&lt;/td&gt;
          &lt;td&gt;上游支持中&lt;/td&gt;
          &lt;td&gt;Intel 与 vLLM 社区合作推进，需特定内核版本和 Docker 部署&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;TensorRT-LLM&lt;/td&gt;
          &lt;td&gt;不支持&lt;/td&gt;
          &lt;td&gt;NVIDIA 独占&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;PMZFX 的测试发现，SYCL 后端的生成速度约为 Vulkan 的 2.2 倍（以 Qwen 1.5B Q4_K_M 为例：229 t/s vs 102 t/s）。&lt;a class=&#34;link&#34; href=&#34;https://github.com/PMZFX/intel-arc-pro-b70-benchmarks/blob/master/FINDINGS.md&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;GitHub 发现汇总&lt;/a&gt;&lt;/p&gt;
&lt;h3 id=&#34;42-vllm-的进展&#34;&gt;4.2 vLLM 的进展
&lt;/h3&gt;&lt;p&gt;vLLM 官方博客于 2025 年 11 月发布了 Intel Arc Pro B 系列 GPU 的支持公告，介绍了针对 MoE 模型的持久化零间隔内核、动态负载均衡等优化，并给出了 8x B60 GPU 上的性能数据。&lt;a class=&#34;link&#34; href=&#34;https://vllm.ai/blog/intel-arc-pro-b&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;vLLM 官方博客&lt;/a&gt;&lt;/p&gt;
&lt;p&gt;需要注意的是，上述博客主要基于 Arc Pro B60（24GB 版本）进行测试，B70（32GB 版本）的 vLLM 性能数据目前仍较有限。&lt;/p&gt;
&lt;h3 id=&#34;43-已知问题与社区反馈&#34;&gt;4.3 已知问题与社区反馈
&lt;/h3&gt;&lt;p&gt;PMZFX 的 GitHub 仓库汇总了多项非显而易见的发现：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Q8_0 量化性能修复&lt;/strong&gt;：社区 PR 合并前，Qwen 27B Q8_0 的生成速度仅为 4.88 t/s，修复后提升至 15.3 t/s（约 3.13 倍）。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;NDEBUG 构建陷阱&lt;/strong&gt;：默认构建配置未启用 &lt;code&gt;-DNDEBUG&lt;/code&gt;，导致断言开销使预填充速度损失近 2 倍。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;双卡层拆分为顺序执行&lt;/strong&gt;：双卡配置不会加速单卡即可容纳的模型，仅对超大模型（如 70B Dense、80B MoE）有意义。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Linux 驱动仍在完善&lt;/strong&gt;：Phoronix 测试时，Intel Xe 驱动尚未通过 sysfs 暴露功耗数据。&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id=&#34;五不同来源的观点&#34;&gt;五、不同来源的观点
&lt;/h2&gt;&lt;h3 id=&#34;51-支持性观点&#34;&gt;5.1 支持性观点
&lt;/h3&gt;&lt;p&gt;Compute Market 的分析认为，截至 2026 年 4 月，Arc Pro B70 是&amp;quot;最便宜的 32GB 本地 LLM 推理 GPU&amp;quot;，是&amp;quot;首个低于 1000 美元的单卡方案，可在 Q4 量化下运行 70B 参数模型&amp;quot;。该分析同时指出，70B 模型在 Q4_K_M 下的权重接近 40GB，32GB 单卡仍需使用 Q3_K_M 或 IQ3_XXS，或进行部分 CPU 卸载。&lt;a class=&#34;link&#34; href=&#34;https://www.compute-market.com/blog/cheapest-32gb-gpu-local-llm-2026&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Compute Market 分析&lt;/a&gt;&lt;/p&gt;
&lt;h3 id=&#34;52-审慎观点&#34;&gt;5.2 审慎观点
&lt;/h3&gt;&lt;p&gt;前 Hugging Face 工程师 Julien Simon 的评论被多家分析引用：&amp;ldquo;Intel Arc 家族目前的处境类似于 2023 年的 AMD ROCm——它能工作，生态真实存在，但你仍然是先驱者。如果你的时间比 1000 美元的差价更值钱，不要买 Arc。&amp;quot;&lt;a class=&#34;link&#34; href=&#34;https://www.compute-market.com/blog/cheapest-32gb-gpu-local-llm-2026&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Compute Market 分析&lt;/a&gt;&lt;/p&gt;
&lt;p&gt;Hardware Corner 的评测结论为：&amp;ldquo;Arc B70 是一张显存优先的 GPU。它在原始速度上无法击败 RTX 3090，但为 27B 到 34B 范围的模型提供了无需多卡配置的高质量推理路径。&amp;quot;&lt;a class=&#34;link&#34; href=&#34;https://www.hardware-corner.net/intel-arc-b70-llm-gpu-march-31/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Hardware Corner&lt;/a&gt;&lt;/p&gt;
&lt;h2 id=&#34;六选购参考&#34;&gt;六、选购参考
&lt;/h2&gt;&lt;p&gt;基于上述数据，不同需求下的硬件选择可参考以下框架：&lt;/p&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th&gt;需求优先级&lt;/th&gt;
          &lt;th&gt;可选方案&lt;/th&gt;
          &lt;th&gt;理由&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td&gt;预算优先，可接受软件配置投入&lt;/td&gt;
          &lt;td&gt;Arc Pro B70&lt;/td&gt;
          &lt;td&gt;32GB 显存成本最低，单卡可跑 27B–35B MoE&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;单用户推理速度优先&lt;/td&gt;
          &lt;td&gt;RTX 3090 / RTX 4090&lt;/td&gt;
          &lt;td&gt;更高显存带宽带来更快生成速度，生态成熟&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;需要 32GB+ 显存且不愿买二手&lt;/td&gt;
          &lt;td&gt;Arc Pro B70&lt;/td&gt;
          &lt;td&gt;新品有保修，避免矿卡风险&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;生产级多并发服务部署&lt;/td&gt;
          &lt;td&gt;RTX 5090 或双 3090&lt;/td&gt;
          &lt;td&gt;vLLM、FlashAttention、CUDA 批处理生态更成熟&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;主要运行 MoE 模型&lt;/td&gt;
          &lt;td&gt;Arc Pro B70&lt;/td&gt;
          &lt;td&gt;MoE 低激活参数量对带宽瓶颈不敏感，能效比高&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;追求开箱即用&lt;/td&gt;
          &lt;td&gt;NVIDIA 方案&lt;/td&gt;
          &lt;td&gt;CUDA 生态的即插即用程度目前仍显著领先&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;h2 id=&#34;七总结&#34;&gt;七、总结
&lt;/h2&gt;&lt;p&gt;Arc Pro B70 的核心优势在于 &lt;strong&gt;32GB 显存与较低的单价&lt;/strong&gt;，使其成为目前单卡 32GB 方案中价格最低的新品。在 MoE 模型（如 Qwen 35B-A3B）上，单卡生成速度可达约 54 t/s，能效比表现较好。但在单流 Dense 模型推理中，其 608 GB/s 的显存带宽低于 RTX 3090（936 GB/s），生成速度通常慢于后者。&lt;/p&gt;
&lt;p&gt;软件生态方面，llama.cpp（SYCL/Vulkan）和 IPEX-LLM 已可用，vLLM 支持正在推进，但配置复杂度高于 CUDA 方案，部分功能需手动编译和调参。TensorRT-LLM 等 NVIDIA 独占工具链目前无法在 B70 上运行。&lt;/p&gt;
&lt;p&gt;对于不愿投入时间进行环境配置的用户，NVIDIA 方案在生态成熟度、开箱即用程度和社区支持广度上仍保持领先。B70 更适合追求显存/价格比、愿意处理软件配置、或主要运行 MoE 模型的场景。&lt;/p&gt;
&lt;h2 id=&#34;八数据来源汇总&#34;&gt;八、数据来源汇总
&lt;/h2&gt;&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th&gt;来源&lt;/th&gt;
          &lt;th&gt;类型&lt;/th&gt;
          &lt;th&gt;URL&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td&gt;Phoronix&lt;/td&gt;
          &lt;td&gt;硬件评测&lt;/td&gt;
          &lt;td&gt;&lt;a class=&#34;link&#34; href=&#34;https://www.phoronix.com/review/intel-arc-pro-b70-linux&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;https://www.phoronix.com/review/intel-arc-pro-b70-linux&lt;/a&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;PMZFX GitHub&lt;/td&gt;
          &lt;td&gt;社区基准测试&lt;/td&gt;
          &lt;td&gt;&lt;a class=&#34;link&#34; href=&#34;https://github.com/PMZFX/intel-arc-pro-b70-benchmarks&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;https://github.com/PMZFX/intel-arc-pro-b70-benchmarks&lt;/a&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;Hardware Corner&lt;/td&gt;
          &lt;td&gt;性能对比分析&lt;/td&gt;
          &lt;td&gt;&lt;a class=&#34;link&#34; href=&#34;https://www.hardware-corner.net/intel-arc-b70-llm-gpu-march-31/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;https://www.hardware-corner.net/intel-arc-b70-llm-gpu-march-31/&lt;/a&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;Compute Market&lt;/td&gt;
          &lt;td&gt;选购分析&lt;/td&gt;
          &lt;td&gt;&lt;a class=&#34;link&#34; href=&#34;https://www.compute-market.com/blog/cheapest-32gb-gpu-local-llm-2026&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;https://www.compute-market.com/blog/cheapest-32gb-gpu-local-llm-2026&lt;/a&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;vLLM 官方博客&lt;/td&gt;
          &lt;td&gt;框架支持公告&lt;/td&gt;
          &lt;td&gt;&lt;a class=&#34;link&#34; href=&#34;https://vllm.ai/blog/intel-arc-pro-b&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;https://vllm.ai/blog/intel-arc-pro-b&lt;/a&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;什么值得买&lt;/td&gt;
          &lt;td&gt;国内售价报道&lt;/td&gt;
          &lt;td&gt;&lt;a class=&#34;link&#34; href=&#34;https://post.smzdm.com/p/apq82nd0/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;https://post.smzdm.com/p/apq82nd0/&lt;/a&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;nickystyle&lt;/td&gt;
          &lt;td&gt;二手显卡价格采集&lt;/td&gt;
          &lt;td&gt;&lt;a class=&#34;link&#34; href=&#34;https://nickys.cn:5201/?p=137&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;https://nickys.cn:5201/?p=137&lt;/a&gt;&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;Intel 官方数据手册&lt;/td&gt;
          &lt;td&gt;规格参数&lt;/td&gt;
          &lt;td&gt;&lt;a class=&#34;link&#34; href=&#34;https://www.intel.com/content/dam/www/central-libraries/us/en/documents/2026-03/datasheet-b70-gpu.pdf&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;https://www.intel.com/content/dam/www/central-libraries/us/en/documents/2026-03/datasheet-b70-gpu.pdf&lt;/a&gt;&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
</description>
        </item>
        <item>
        <title>DeepSeek V4 发布：百万上下文普惠时代到来，双模型策略解析</title>
        <link>https://torchtree.com/post/deepseek-v4-release/</link>
        <pubDate>Fri, 24 Apr 2026 04:41:50 +0800</pubDate>
        
        <guid>https://torchtree.com/post/deepseek-v4-release/</guid>
        <description>&lt;p&gt;2026 年 4 月 23 日，深度求索（DeepSeek）正式发布 &lt;strong&gt;DeepSeek-V4 预览版&lt;/strong&gt;，并同步开源模型权重。这是继 V3 系列之后，DeepSeek 在 MoE（Mixture-of-Experts）架构上的又一次重大迭代。官方将其定位为&amp;quot;迈入百万上下文普惠时代&amp;quot;，1M token 上下文长度成为所有官方服务的标配。&lt;/p&gt;
&lt;p&gt;本文基于官方发布信息、API 文档、HuggingFace 技术报告以及 V2EX 等中文技术社区的初步讨论，对 V4 的核心技术特点、产品策略和早期市场反馈进行梳理。&lt;/p&gt;
&lt;h2 id=&#34;一双模型策略pro-与-flash-的分工&#34;&gt;一、双模型策略：Pro 与 Flash 的分工
&lt;/h2&gt;&lt;p&gt;DeepSeek-V4 采用双版本并行策略，覆盖不同场景的性能与成本需求：&lt;/p&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th&gt;维度&lt;/th&gt;
          &lt;th&gt;DeepSeek-V4-Pro&lt;/th&gt;
          &lt;th&gt;DeepSeek-V4-Flash&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td&gt;总参数量&lt;/td&gt;
          &lt;td&gt;1.6T&lt;/td&gt;
          &lt;td&gt;284B&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;激活参数量&lt;/td&gt;
          &lt;td&gt;49B&lt;/td&gt;
          &lt;td&gt;13B&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;上下文长度&lt;/td&gt;
          &lt;td&gt;1M&lt;/td&gt;
          &lt;td&gt;1M&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;最大输出长度&lt;/td&gt;
          &lt;td&gt;384K&lt;/td&gt;
          &lt;td&gt;384K&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;精度&lt;/td&gt;
          &lt;td&gt;FP8 Mixed&lt;/td&gt;
          &lt;td&gt;FP4+FP8 Mixed&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;输入定价（缓存命中/百万 tokens）&lt;/td&gt;
          &lt;td&gt;1 元&lt;/td&gt;
          &lt;td&gt;0.2 元&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;输入定价（缓存未命中/百万 tokens）&lt;/td&gt;
          &lt;td&gt;12 元&lt;/td&gt;
          &lt;td&gt;1 元&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;输出定价（百万 tokens）&lt;/td&gt;
          &lt;td&gt;24 元&lt;/td&gt;
          &lt;td&gt;2 元&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;Pro 版本面向需要最强推理和知识能力的场景，Flash 版本则主打性价比和快速响应。官方在微信公众号文章中提到，Pro 版本的 Agentic Coding 能力已超越 Sonnet 4.5，交付质量接近 Opus 4.6 非思考模式，但与 Opus 4.6 思考模式仍存在一定差距。&lt;/p&gt;
&lt;h2 id=&#34;二三大架构创新&#34;&gt;二、三大架构创新
&lt;/h2&gt;&lt;p&gt;根据 &lt;a class=&#34;link&#34; href=&#34;https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro/blob/main/DeepSeek_V4.pdf&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;HuggingFace 技术报告&lt;/a&gt;，V4 系列引入了以下关键架构升级：&lt;/p&gt;
&lt;h3 id=&#34;1-混合注意力机制csa--hca&#34;&gt;1. 混合注意力机制（CSA + HCA）
&lt;/h3&gt;&lt;p&gt;V4 设计了结合 &lt;strong&gt;Compressed Sparse Attention（CSA）&lt;/strong&gt; 与 &lt;strong&gt;Heavily Compressed Attention（HCA）&lt;/strong&gt; 的混合注意力架构，在 1M token 长上下文场景下实现了显著的效率提升。技术报告显示，DeepSeek-V4-Pro 在该场景下的单 token 推理 FLOPs 仅为 V3.2 的 &lt;strong&gt;27%&lt;/strong&gt;，KV 缓存仅为 &lt;strong&gt;10%&lt;/strong&gt;。&lt;/p&gt;
&lt;h3 id=&#34;2-manifold-constrained-hyper-connectionsmhc&#34;&gt;2. Manifold-Constrained Hyper-Connections（mHC）
&lt;/h3&gt;&lt;p&gt;mHC 用于强化传统的残差连接，在保持模型表达能力的同时，增强跨层信号传播的稳定性。&lt;/p&gt;
&lt;h3 id=&#34;3-muon-optimizer&#34;&gt;3. Muon Optimizer
&lt;/h3&gt;&lt;p&gt;训练阶段采用 Muon 优化器，官方称其在收敛速度和训练稳定性方面优于传统方案。&lt;/p&gt;
&lt;h2 id=&#34;三训练与后训练范式&#34;&gt;三、训练与后训练范式
&lt;/h2&gt;&lt;p&gt;V4 系列的预训练数据量超过 &lt;strong&gt;32T&lt;/strong&gt; token。后训练采用两阶段范式：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;独立培养领域专家&lt;/strong&gt;：通过 SFT 和 GRPO（Group Relative Policy Optimization）强化学习，分别训练不同领域的专家能力&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;统一模型整合&lt;/strong&gt;：通过 on-policy distillation 将各领域专家能力蒸馏整合到单一模型中&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;这种&amp;quot;先分后合&amp;quot;的策略，旨在让最终模型在代码、推理、知识等多个领域同时达到高水平。&lt;/p&gt;
&lt;h2 id=&#34;四api-与产品变化&#34;&gt;四、API 与产品变化
&lt;/h2&gt;&lt;h3 id=&#34;模型名更新&#34;&gt;模型名更新
&lt;/h3&gt;&lt;p&gt;API 调用时，base_url 保持不变（&lt;code&gt;https://api.deepseek.com&lt;/code&gt;），model 参数需更新为：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;code&gt;deepseek-v4-pro&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;deepseek-v4-flash&lt;/code&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;旧模型名 &lt;code&gt;deepseek-chat&lt;/code&gt; 和 &lt;code&gt;deepseek-reasoner&lt;/code&gt; 将于 &lt;strong&gt;2026 年 7 月 24 日&lt;/strong&gt; 废弃。出于兼容考虑，二者目前分别映射到 Flash 的非思考模式和思考模式。&lt;/p&gt;
&lt;h3 id=&#34;思考模式thinking-mode&#34;&gt;思考模式（Thinking Mode）
&lt;/h3&gt;&lt;p&gt;V4 两个版本均支持思考模式，默认开启。API 通过以下参数控制：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;code&gt;thinking: {type: &amp;quot;enabled/disabled&amp;quot;}&lt;/code&gt; — 思考模式开关&lt;/li&gt;
&lt;li&gt;&lt;code&gt;reasoning_effort: &amp;quot;high/max&amp;quot;&lt;/code&gt; — 思考强度控制&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;思考内容通过 &lt;code&gt;reasoning_content&lt;/code&gt; 字段返回，与 &lt;code&gt;content&lt;/code&gt; 同级。需要注意的是，思考模式下不支持 &lt;code&gt;temperature&lt;/code&gt;、&lt;code&gt;top_p&lt;/code&gt;、&lt;code&gt;presence_penalty&lt;/code&gt;、&lt;code&gt;frequency_penalty&lt;/code&gt; 参数。&lt;/p&gt;
&lt;p&gt;详细文档可参考 &lt;a class=&#34;link&#34; href=&#34;https://api-docs.deepseek.com/zh-cn/guides/thinking_mode&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;DeepSeek 思考模式指南&lt;/a&gt;。&lt;/p&gt;
&lt;h2 id=&#34;五社区初步反馈&#34;&gt;五、社区初步反馈
&lt;/h2&gt;&lt;p&gt;V4 发布后，V2EX &lt;a class=&#34;link&#34; href=&#34;https://www.v2ex.com/go/deepseek&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;deepseek 节点&lt;/a&gt; 和 HuggingFace 讨论区迅速出现大量讨论。以下是截至 4 月 24 日中午的主要反馈类型：&lt;/p&gt;
&lt;h3 id=&#34;正面评价&#34;&gt;正面评价
&lt;/h3&gt;&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;期待兑现&lt;/strong&gt;：&amp;ldquo;从去年 12 月就开始传，终于正式发布&amp;rdquo;&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;架构认可&lt;/strong&gt;：1.6T 参数规模配合 MoE 架构，被认为&amp;quot;值得探索其逻辑潜力&amp;quot;&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;开源态度&lt;/strong&gt;：HuggingFace 讨论区大量用户打卡支持，&amp;ldquo;源神牛逼&amp;rdquo;、&amp;ldquo;国货之光&amp;quot;等评价集中出现&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;长上下文普惠&lt;/strong&gt;：1M 上下文成为标配，被视作降低长文本应用门槛的积极信号&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id=&#34;质疑与担忧&#34;&gt;质疑与担忧
&lt;/h3&gt;&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;定价争议&lt;/strong&gt;：Pro 版本定价（输入 12 元/百万 tokens、输出 24 元/百万 tokens）被部分用户认为偏高，&amp;ldquo;只能用得起 Flash&amp;quot;成为常见说法&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;与闭源差距&lt;/strong&gt;：官方自身承认与 Opus 4.6 思考模式存在差距；社区有用户直言&amp;quot;刚出来就被 GPT-5.5 当头一棒&amp;rdquo;&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Web 版实际体验&lt;/strong&gt;：有用户指出官方 Web 端给普通用户实际使用的是 Flash 版本，&amp;ldquo;专家模式&amp;quot;也并非 Pro 版，前几周 Web 体验&amp;quot;绝对性能没达到期待&amp;rdquo;&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;实用性存疑&lt;/strong&gt;：&amp;ldquo;Pro 版本似乎贵了挺多，但也没多好用&amp;rdquo;——部分早期体验者的直观感受&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id=&#34;技术讨论&#34;&gt;技术讨论
&lt;/h3&gt;&lt;ul&gt;
&lt;li&gt;本地部署硬件需求成为热点话题，FP8/FP4 量化方案引发讨论&lt;/li&gt;
&lt;li&gt;推理框架适配：社区关注 vLLM、SGLang 等框架何时支持 V4&lt;/li&gt;
&lt;li&gt;昇腾支持：有用户提到&amp;quot;支持了昇腾&amp;rdquo;，但具体适配情况尚不明确&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id=&#34;六昇腾支持现状&#34;&gt;六、昇腾支持现状
&lt;/h2&gt;&lt;p&gt;关于华为昇腾（Ascend）芯片的适配情况，目前的信息较为有限：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;官方立场&lt;/strong&gt;：DeepSeek 官方目前未在其公开仓库中提供对昇腾芯片的正式支持或适配计划。在 GitHub 相关 issue 中，官方贡献者曾回应用户&amp;quot;请向华为昇腾寻求更多支持&amp;quot;，暗示当前主要由第三方或社区驱动适配&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;社区动态&lt;/strong&gt;：V2EX 讨论中有用户提到 V4 &amp;ldquo;支持了昇腾&amp;rdquo;，但缺乏具体的技术细节（如支持的昇腾型号、推理框架、性能数据等）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;媒体层面&lt;/strong&gt;：截至发稿，尚未发现国内主流科技媒体有关于 DeepSeek V4 正式适配昇腾的深度报道或性能评测&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;若业务依赖昇腾部署，建议关注华为昇腾官方社区（MindSpore 或 Ascend 开发者社区）是否有相关的推理适配方案，而非等待 DeepSeek 官方提供原生支持。&lt;/p&gt;
&lt;h2 id=&#34;七小结&#34;&gt;七、小结
&lt;/h2&gt;&lt;p&gt;DeepSeek-V4 的发布延续了该团队&amp;quot;开源 + 高性价比&amp;quot;的核心策略。1M 上下文普惠化、MoE 架构效率优化、以及 Pro/Flash 的双版本覆盖，构成了其产品竞争力的基本面。&lt;/p&gt;
&lt;p&gt;不过，从社区早期反馈来看，以下几点值得关注：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;定价敏感度&lt;/strong&gt;：Pro 版本定价较 V3 时代有明显提升，用户是否会为此买单，取决于其实际性能能否在复杂任务中体现出与 Flash 的显著差异&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;与闭源模型的竞争&lt;/strong&gt;：官方承认与 Opus 4.6 思考模式存在差距，而 GPT-5.5 等闭源模型的迭代速度仍在加快&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;生态适配&lt;/strong&gt;：昇腾支持、推理框架集成等生态建设尚处于早期，可能影响企业级用户的采纳决策&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;深度实测对比（与 GPT-5.x、Claude Opus 4.x、GLM-5.1 等）预计将在未来 1-3 天内陆续出现，届时可对 V4 的真实竞争力做出更准确的判断。&lt;/p&gt;
&lt;h2 id=&#34;参考来源&#34;&gt;参考来源
&lt;/h2&gt;&lt;ul&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://mp.weixin.qq.com/s/8bxXqS2R8Fx5-1TLDBiEDg&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;DeepSeek 官方微信公众号发布&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://api-docs.deepseek.com/zh-cn/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;DeepSeek API 文档首页&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://api-docs.deepseek.com/zh-cn/quick_start/pricing&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;DeepSeek API 定价页面&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://api-docs.deepseek.com/zh-cn/guides/thinking_mode&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;DeepSeek 思考模式指南&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://huggingface.co/collections/deepseek-ai/deepseek-v4&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;HuggingFace DeepSeek-V4 系列模型页面&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro/blob/main/DeepSeek_V4.pdf&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;DeepSeek-V4 技术报告 PDF&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://www.v2ex.com/t/1208217&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;V2EX Deepseek V4 讨论帖&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
</description>
        </item>
        <item>
        <title>量化模型 Q4 与 UD-Q4 的关键区别</title>
        <link>https://torchtree.com/post/llm-quantization-q4-vs-ud-q4-guide/</link>
        <pubDate>Thu, 23 Apr 2026 05:32:47 +0800</pubDate>
        
        <guid>https://torchtree.com/post/llm-quantization-q4-vs-ud-q4-guide/</guid>
        <description>&lt;p&gt;在大型语言模型（LLM）的本地部署与推理优化中，量化技术（Quantization）是降低显存占用、提升运行速度的关键。其中，&lt;strong&gt;Q4&lt;/strong&gt;（4-bit 量化）因其在性能与精度之间的卓越平衡，已成为行业事实上的“黄金标准”。&lt;/p&gt;
&lt;p&gt;近期，随着 &lt;strong&gt;Unsloth&lt;/strong&gt; 等优化框架的流行，一种名为 &lt;strong&gt;UD-Q4&lt;/strong&gt;（Unsloth Dynamic Q4）的新格式进入了开发者视野。本文将深入解析标准 Q4 与 UD-Q4 的核心差异，并探讨 4-bit 量化在模型量化领域中的重要地位。&lt;/p&gt;
&lt;h2 id=&#34;1-核心定义与技术差异&#34;&gt;1. 核心定义与技术差异
&lt;/h2&gt;&lt;h3 id=&#34;q4-standard-quantization&#34;&gt;Q4 (Standard Quantization)
&lt;/h3&gt;&lt;p&gt;标准的 4-bit 量化（如 GGUF 格式中的 &lt;code&gt;Q4_K_M&lt;/code&gt; 或更早期的 &lt;code&gt;Q4_0&lt;/code&gt;）通常采用&lt;strong&gt;静态量化策略&lt;/strong&gt;。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;比特分配&lt;/strong&gt;：每一层、每一个权重块都使用固定的比特数（4-bit）。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;技术特点&lt;/strong&gt;：实现相对简单，推理后端兼容性极佳。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;局限性&lt;/strong&gt;：对所有权重“一视同仁”，无法针对模型中更重要的层（如注意力机制的关键权重）进行重点保护。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id=&#34;ud-q4-unsloth-dynamic-q4&#34;&gt;UD-Q4 (Unsloth Dynamic Q4)
&lt;/h3&gt;&lt;p&gt;&lt;strong&gt;UD-Q4&lt;/strong&gt; 代表 &lt;strong&gt;Unsloth Dynamic&lt;/strong&gt; 动态量化。它通过改变“均匀分配”的思路，引入了更精细的优化。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;动态比特分配&lt;/strong&gt;：根据权重对模型输出的影响力（通常结合 &lt;code&gt;imatrix&lt;/code&gt; 数据校准），动态调整不同层的比特数。核心层可能分配到 6-bit，而次要层则降低至 3-bit。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;精度优势&lt;/strong&gt;：在维持平均 4-bit（bpw ≈ 4.5）的前提下，UD-Q4 能够通过这种“拆东墙补西墙”的策略，显著降低量化损耗（Perplexity），其精度表现往往能逼近传统的 5-bit 模型。&lt;/li&gt;
&lt;/ul&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th&gt;特性&lt;/th&gt;
          &lt;th&gt;标准 Q4 (Q4_K_M)&lt;/th&gt;
          &lt;th&gt;Unsloth UD-Q4&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;!-- raw HTML omitted --&gt;量化策略&lt;!-- raw HTML omitted --&gt;&lt;/td&gt;
          &lt;td&gt;静态/固定&lt;/td&gt;
          &lt;td&gt;动态/重要性感知&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;!-- raw HTML omitted --&gt;平均精度&lt;!-- raw HTML omitted --&gt;&lt;/td&gt;
          &lt;td&gt;行业基准&lt;/td&gt;
          &lt;td&gt;高于基准，逼近 Q5&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;!-- raw HTML omitted --&gt;计算开销&lt;!-- raw HTML omitted --&gt;&lt;/td&gt;
          &lt;td&gt;极低&lt;/td&gt;
          &lt;td&gt;略高（仅在量化阶段），推理一致&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;!-- raw HTML omitted --&gt;适用场景&lt;!-- raw HTML omitted --&gt;&lt;/td&gt;
          &lt;td&gt;通用、高性能&lt;/td&gt;
          &lt;td&gt;追求极致精度与体积平衡&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;h2 id=&#34;2-q4-在量化领域中的标准地位&#34;&gt;2. Q4 在量化领域中的标准地位
&lt;/h2&gt;&lt;p&gt;在 LLM 的发展史中，4-bit 量化（Q4）的出现是一个里程碑。它之所以能占据统治地位，主要源于以下三个维度的平衡：&lt;/p&gt;
&lt;h3 id=&#34;21-精度与压缩比的甜蜜点&#34;&gt;2.1 精度与压缩比的“甜蜜点”
&lt;/h3&gt;&lt;p&gt;根据大量的学术研究（如 &lt;em&gt;GPTQ&lt;/em&gt; 和 &lt;em&gt;GGUF/llama.cpp&lt;/em&gt; 的测试数据），模型精度随比特数减少的曲线在 4-bit 处通常表现为一个“拐点”。高于 4-bit（如 5-bit、8-bit）带来的精度提升边际效应递减；而低于 4-bit（如 3-bit、2-bit）则会导致精度出现断崖式下跌。&lt;/p&gt;
&lt;h3 id=&#34;22-显存容量的适配性&#34;&gt;2.2 显存容量的适配性
&lt;/h3&gt;&lt;p&gt;4-bit 量化能将原始 FP16 权重的体积缩小约 4 倍（考虑到元数据，实际约为 3.5-3.8 倍）。这使得：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;7B/8B 参数模型可以在 &lt;strong&gt;6GB/8GB&lt;/strong&gt; 显存的家用显卡上流畅运行。&lt;/li&gt;
&lt;li&gt;70B 参数模型可以在 &lt;strong&gt;48GB&lt;/strong&gt; 显存（如双 A6000 或 Mac 共享内存）环境下部署。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id=&#34;23-硬件加速的支持&#34;&gt;2.3 硬件加速的支持
&lt;/h3&gt;&lt;p&gt;目前的 GPU 和 NPU（如 Apple Silicon 的 Neural Engine）对 4-bit 计算有着良好的原生或指令集级优化支持。相比于非标准的 3.5-bit 等格式，Q4 在数据对齐和计算效率上更具天然优势。&lt;/p&gt;
&lt;h2 id=&#34;结论&#34;&gt;结论
&lt;/h2&gt;&lt;p&gt;&lt;strong&gt;Q4 (Q4_K_M)&lt;/strong&gt; 是目前 LLM 本地推理的&lt;strong&gt;工业标准&lt;/strong&gt;，代表了最广泛的兼容性与可靠的性能。而 &lt;strong&gt;UD-Q4&lt;/strong&gt; 则是技术演进的下一步，通过&lt;strong&gt;重要性感知&lt;/strong&gt;的动态分配，在不改变硬件门槛的前提下，榨取模型最后的精度潜力。&lt;/p&gt;
&lt;p&gt;对于普通用户，&lt;code&gt;Q4_K_M&lt;/code&gt; 始终是“闭眼选”的安全牌；而对于希望在有限显存下获得更聪明回复的开发者，&lt;code&gt;UD-Q4&lt;/code&gt; 无疑是当下的最优解。&lt;/p&gt;
&lt;h2 id=&#34;引用与相关资料&#34;&gt;引用与相关资料
&lt;/h2&gt;&lt;ul&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://medium.com/@paul.ilvez/demystifying-llm-quantization-suffixes-what-q4-k-m-q8-0-and-q6-k-really-mean-0ec2770f17d3&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Demystifying LLM Quantization Suffixes: What Q4_K_M, Q8_0, and Q6_K really mean&lt;/a&gt; - Medium&lt;/li&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://www.hardware-corner.net/quantization-local-llms-formats/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Quantization for Local LLMs: How It Works and Which Formats Fit Your Setup&lt;/a&gt; - Hardware Corner&lt;/li&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://kaitchup.substack.com/p/choosing-a-gguf-model-k-quants-i&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Choosing a GGUF Model: K-Quants, I-Quants, and Legacy Formats&lt;/a&gt; - Kaitchup Substack&lt;/li&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://willitrunai.com/blog/quantization-guide-gguf-explained&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;GGUF Quantization Explained — Q4_K_M vs Q5_K_M vs Q8: VRAM, Quality&lt;/a&gt; - Will It Run AI&lt;/li&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://huggingface.co/unsloth&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Unsloth Model Explorer (for UD-Q4 variants)&lt;/a&gt; - Hugging Face&lt;/li&gt;
&lt;/ul&gt;
</description>
        </item>
        
    </channel>
</rss>
