InternLM 系列(书生)

★★★★★ 4.6 分

上海AI实验室开源的「书生」大模型,中文评测强、工具调用稳定,1.8B 轻量版手机级显存可跑。

中文通用开源学术
参数量InternLM2.5 1.8B / 7B / 20B / InternLM3
模型类型对话 + 工具调用大语言模型
许可证Apache 2.0
开发者上海人工智能实验室
★★★★★ 4.4

上海AI实验室开源,中文基准与端侧双强

中文开源工具调用科研

模型介绍

InternLM(书生)是上海人工智能实验室开源的系列大模型,从 2023 年的 InternLM 起就以中文基准强度著称。2024 年的 InternLM2.5 强化了工具调用与 100 万字长文档(200K 上下文)场景,2025 年的 InternLM3 全新 tokenizer 与强化学习提升了代码和通用能力,2026 年的 Intern-S2 则覆盖 397B 级多模态科研(Intern-VL 同源)。1.8B 轻量版在手机级设备可流畅运行,配套的 LMDeploy 与 OpenCompass 已成为中文大模型科研生态的重要基础设施。

模型基本信息

开发机构上海人工智能实验室(OpenBMB 合作)
模型版本InternLM3(2025)/ Intern-S2(2026)
参数规模1.7B/7B/8B/20B 稠密;Intern-S2-Preview-397B(多模态科研基座)
模型类型文本对话 / 科研多模态(Intern-S2)
许可证Apache-2.0(InternLM3/S2);InternLM2.5 为自定义许可
上下文长度32K~200K(InternLM2.5 长文档版);8K~32K(InternLM3);256K(Intern-S2)
发布日期2024-06-27(internlm2_5-7b-chat);2025-01-13(internlm3-8b-instruct);2026-07-16(Intern-S2-Preview-397B)
模型架构Decoder-only Transformer + GQA;InternLM3 新一代 tokenizer + chunked attention;Intern-S2 为多模态混合架构(InternS2PreviewForConditionalGeneration)

模型能力

中文能力很强
英文能力强
代码能力强(InternLM3 增强)
推理能力强
长文本能力很强(200K/256K)
视觉能力很强(Intern-S2 / InternVL)
工具调用很强(工具调用)

模型版本

Intern-S2-Preview-397B397B 多模态科研基座InternLM3-8B-Instruct8BInternLM2.5-20B-Chat20BInternLM2.5-7B-Chat7BInternLM2-1.8B1.8B(端侧)

模型获取

部署方式

OllamaLM Studiollama.cppvLLMtransformersLMDeploy

显存需求

InternLM2-1.8B Q4约1.5GB
InternLM2.5-7B Q4约5GB
InternLM3-8B Q4约6GB
InternLM2.5-20B Q4约12GB

硬件推荐

RTX 3060InternLM 1.8B~8B(Q4)
RTX 30908B~20B Q4
RTX 409020B Q4 舒适
RTX 509020B FP16
MacM 系列 1.8B~8B 流畅

推荐配置

入门RTX 3060 12G + InternLM3-8B Q4 约6GB
进阶RTX 3090/4090 24G + InternLM2.5-20B Q4 约12GB
专业A100/H100 ×8 + Intern-S2-397B / InternVL

为什么选择这个模型

  • 中文基准强度与语料质量高
  • 端侧到科研全系列
  • 1.8B 手机级可跑、初步低门槛
  • 配套 LMDeploy/OpenCompass 科研生态

模型优点

  • 中文评测稳定
  • 工具调用训练充分
  • 1.8B 端侧友好
  • Intern-S2 多模态科研 397B
  • Apache-2.0(3 代/S2)

模型缺点

  • 国外生态与社区热度低于 Qwen/Llama
  • 代码上限中等
  • InternLM3 新 tokenizer 社区适配滞后
  • 旗舰 397B 需集群

适合场景

  • 中文对话与客服
  • 工具调用 Agent
  • 端侧/边缘部署(1.8B)
  • 科研复现(Intern-S2)
  • OpenCompass 榜单对照

不适合场景

  • 大规模英文生产首选
  • 代码优先开发
  • 多模态轻量(另有 InternVL)
  • 最新国际生态工具适配

部署教程

Ollama
官方无标签,可用社区 GGUF 或 modelscope 下载后转 GGUF;最简单用 vLLM/LMDeploy
LM Studio
LM Studio 加载社区 InternLM GGUF
llama.cpp
./llama-cli -m internlm3-8b-instruct-q4_k_m.gguf -p 提示词 -ngl 999
vLLM
pip install vllm && vllm serve internlm/internlm3-8b-instruct

智算工坊实验室

实测速度InternLM3-8B Q4 ≈38-42 token/s(RTX 3060)
显存占用8B Q4 约6GB;1.8B Q4 约1.5GB
功耗单卡满载约170W
不同 GPU 对比1.8B 在低端卡/CPU 均可;20B 适合 24GB 显存

常见问题 FAQ

InternLM3 与 InternLM2.5 选谁?

新任务选 InternLM3(新 tokenizer、更强代码和推理、Apache-2.0);需要 200K 长文档或 20B 参数选 InternLM2.5。

想在本地跑廉价方案?

InternLM2-1.8B 仅需约 1.5GB 显存,适合低端机器/手机端实验;8B 在 12GB 卡很流畅。

相关模型

相关工具

相关硬件

相关文章

数据来源

  • https://huggingface.co/internlm/internlm3-8b-instruct
  • https://huggingface.co/internlm/internlm2_5-7b-chat
  • https://huggingface.co/internlm/Intern-S2-Preview-397B
  • https://internlm.ai/