← 返回课程列表
端侧 AI 革命:把大模型装进手机和笔记本

端侧 AI 革命:把大模型装进手机和笔记本

二、主题课程(Course) ### 模块 1 · 为什么要「端侧」 云端大模型有三道坎:**延迟、隐私、成本**。每一次提问都要把数据传上云、等推理、再传回来;你的对话内容出了设备;高并发下推理账单飞涨。端侧(on-device)把模型直接跑在手机/笔记本/边缘盒子上,数据不出本机,响应即时,边际成本趋近于零。 2026 年 9 月 9 日,面壁智能(ModelBest / OpenBMB)发布 **MiniCPM5-2B**:仅靠 2B 参数,在端侧 Agent 基准上登顶开源阵营(详见今日热点《MiniCPM5-2B:2B 参数登顶开源》)。它不是「更小的玩具」,而是证明「够用的智能」可以住进你的口袋。 ### 模块 2 · 把模型塞进小设备的四件武器 1. **量化(Quantization)**:把权重从 16 位浮点压到 4 位甚至 2 位整数。精度略损,体积与算力需求骤降。INT4 量化常能把模型压到原来的 1/4。 2. **蒸馏(Distillation)**:用大模型当老师,小模型当学生,让小模型学老师的输出分布,而不是从零学数据。 3. **KV Cache 复用**:自回归生成时,已算过的历史 token 的键值向量要缓存复用,否则每生成一个字都要重算全序列——这是端侧长上下文的关键。 4. **投机解码(Speculative Decoding)**:用小模型先「草稿」猜几个词,大模型一次性校验,把串行生成变并行,提速明显。 大模型(老师) 蒸馏 小模型(端侧) 量化 16→4bit KV Cache 投机解码 ### 模块 3 · 动手:一个最小的端侧 Agent 骨架 下面这段 Python 展示「本地模型 + 工具调用」的最小闭环(伪代码风格,真实部署请用对应推理框架的 API): ```python # 极简示意:端侧 Agent 的「思考-调用-观察」循环 def agent_loop(model, tools, user_msg, max_steps=5): history = [{"role": "user", "content": user_msg}] for _ in range(max_steps): resp = model.generate(history, tools=tools) # 本地小模型推理 if resp.tool_call: # 模型决定调用工具 result = call_tool(resp.tool_call, tools) history.append({"role": "tool", "content": result}) continue return resp.text # 不再需要工具,给出答案 return "已达最大步数" ``` 要点:**模型负责「决策」,工具负责「执行」**。端侧模型的强项不是取代云端大模型,而是在本地完成轻量决策与编排,把重活(如需要海量知识)再上云。这种「端云协同」才是 2026 年落地的主流形态。 ### 模块 4 · 你能用它做什么 - **隐私助手**:本地总结邮件、整理笔记,数据不离机。 - **离线 Agent**:没网也能跑的导航、翻译、日程编排。 - **边缘智能**:工厂摄像头本地做缺陷检测,不依赖带宽。 端侧不是「云端降级版」,而是把智能**分发到每一个设备**的新范式。下一步,看谁先把「够用的 2B」做成人人手机里默认的一部分。 ---
端侧 AI 革命:把大模型装进手机和笔记本 | 必学必会