本地推理 · 工具调用微调 · Apache 2.0
把工具调用,装进 2B 本地模型。
LycheeAI-coder-2b-II-pro 是基于 MiniCPM5-2B 进行 LoRA 微调的中文编程助手。重点不是替代大模型,而是在自己的电脑上,以更低的资源占用完成代码问答和可控的工具调用。
BASE MODEL · MINICPM5-2B
小底座,也有完整的能力基础
MiniCPM5-2B 是 OpenBMB 面向本地助手、Coding Agent、工具调用与紧凑推理场景发布的稠密模型。以下底座数据只取自 MiniCPM5-2B 官方模型卡,不混用系列中其他型号的参数或评测。
LlamaForCausalLM,官方提供 Transformers、vLLM、SGLang、llama.cpp、MLX 与 GGUF 等运行路径。WHY LOCAL 2B
小,是明确的取舍
2B 参数换来的不是云端大模型级推理,而是低占用、快响应和代码不离开设备。适合个人开发者做本地代码问答,也适合作为小型 Agent 的工具路由核心。
- 推理可以完全离线模型加载到本机后,无需把代码发送给第三方模型服务。
- 围绕工具调用训练覆盖单步、多步、并列调用和工具结果解读,默认输出裸 JSON。
- 三种格式按设备选择Mac 用 MLX,Ollama / llama.cpp 用 GGUF,继续微调或 CUDA 用 f16。
- 训练过程可复现LoRA 数据、训练脚本和回归检查随项目公开,许可为 Apache 2.0。
TOOL CALLING
它负责决定,宿主负责执行
模型输出工具名与参数,宿主校验后执行,再把结果喂回模型。这个边界让本地模型保持轻量,也让权限掌握在你的程序手里。
帮我算一下 789×123{"name":"calculate","arguments":{"expression":"789*123"}}97047789 × 123 = 97047。注意:Ollama 对该模型的裸 JSON 不一定自动映射为 tool_calls,宿主应从 content 兜底解析,并校验工具注册表。
CHOOSE A BUILD
按运行方式选版本
同一模型提供三条路径。下面的体积来自项目文档;实际内存、速度会随硬件和运行时变化。
MLX 4bit
1.42 GB · ~1.5 GB RAM
面向 Apple Silicon,本项目实测生成速度最高,适合直接对话或启动 OpenAI 兼容服务。
打开 MLX 仓库 →GGUF q8_0
2.50 GB · ~3 GB RAM
适合 Ollama 与 llama.cpp。工具调用场景优先 q8_0,格式稳定性通常比更低量化档更合适。
打开 GGUF 仓库 →f16
5.03 GB · ~5.5 GB RAM
用于 CUDA、二次量化或继续微调。只想在 Mac 本地使用时,没有必要下载这一版。
打开 f16 仓库 →QUICK START
在 Apple Silicon 上跑起来
先安装 MLX-LM,再加载 4bit 仓库。首次运行需要联网下载模型,下载完成后可以离线推理。
# 安装运行时 pip install mlx-lm # 一次性问答 python -m mlx_lm.generate \ --model whcl412/LycheeAI-coder-2b-II-pro \ --prompt "帮我写个快速排序" # 或启动 OpenAI 兼容服务 python -m mlx_lm.server \ --model whcl412/LycheeAI-coder-2b-II-pro --port 8080
KNOWN LIMITS
先知道它做不到什么
这是 2B 个人微调模型,不应按 GPT、Claude 或 DeepSeek 的能力标准使用。生产接入必须由宿主做校验、限步和错误兜底。
calculate。tool_calls,没有时再从正文解析裸 JSON。