上海AI实验室开源,中文基准与端侧双强
模型介绍
InternLM(书生)是上海人工智能实验室开源的系列大模型,从 2023 年的 InternLM 起就以中文基准强度著称。2024 年的 InternLM2.5 强化了工具调用与 100 万字长文档(200K 上下文)场景,2025 年的 InternLM3 全新 tokenizer 与强化学习提升了代码和通用能力,2026 年的 Intern-S2 则覆盖 397B 级多模态科研(Intern-VL 同源)。1.8B 轻量版在手机级设备可流畅运行,配套的 LMDeploy 与 OpenCompass 已成为中文大模型科研生态的重要基础设施。
模型基本信息
开发机构上海人工智能实验室(OpenBMB 合作)
模型版本InternLM3(2025)/ Intern-S2(2026)
参数规模1.7B/7B/8B/20B 稠密;Intern-S2-Preview-397B(多模态科研基座)
模型类型文本对话 / 科研多模态(Intern-S2)
许可证Apache-2.0(InternLM3/S2);InternLM2.5 为自定义许可
上下文长度32K~200K(InternLM2.5 长文档版);8K~32K(InternLM3);256K(Intern-S2)
发布日期2024-06-27(internlm2_5-7b-chat);2025-01-13(internlm3-8b-instruct);2026-07-16(Intern-S2-Preview-397B)
模型架构Decoder-only Transformer + GQA;InternLM3 新一代 tokenizer + chunked attention;Intern-S2 为多模态混合架构(InternS2PreviewForConditionalGeneration)
模型能力
中文能力很强
英文能力强
代码能力强(InternLM3 增强)
推理能力强
长文本能力很强(200K/256K)
视觉能力很强(Intern-S2 / InternVL)
工具调用很强(工具调用)
模型版本
Intern-S2-Preview-397B397B 多模态科研基座InternLM3-8B-Instruct8BInternLM2.5-20B-Chat20BInternLM2.5-7B-Chat7BInternLM2-1.8B1.8B(端侧)
模型获取
部署方式
OllamaLM Studiollama.cppvLLMtransformersLMDeploy
显存需求
InternLM2-1.8B Q4约1.5GB
InternLM2.5-7B Q4约5GB
InternLM3-8B Q4约6GB
InternLM2.5-20B Q4约12GB
硬件推荐
RTX 3060InternLM 1.8B~8B(Q4)
RTX 30908B~20B Q4
RTX 409020B Q4 舒适
RTX 509020B FP16
MacM 系列 1.8B~8B 流畅
推荐配置
入门RTX 3060 12G + InternLM3-8B Q4 约6GB
进阶RTX 3090/4090 24G + InternLM2.5-20B Q4 约12GB
专业A100/H100 ×8 + Intern-S2-397B / InternVL
为什么选择这个模型
- 中文基准强度与语料质量高
- 端侧到科研全系列
- 1.8B 手机级可跑、初步低门槛
- 配套 LMDeploy/OpenCompass 科研生态
模型优点
- 中文评测稳定
- 工具调用训练充分
- 1.8B 端侧友好
- Intern-S2 多模态科研 397B
- Apache-2.0(3 代/S2)
模型缺点
- 国外生态与社区热度低于 Qwen/Llama
- 代码上限中等
- InternLM3 新 tokenizer 社区适配滞后
- 旗舰 397B 需集群
适合场景
- 中文对话与客服
- 工具调用 Agent
- 端侧/边缘部署(1.8B)
- 科研复现(Intern-S2)
- OpenCompass 榜单对照
不适合场景
- 大规模英文生产首选
- 代码优先开发
- 多模态轻量(另有 InternVL)
- 最新国际生态工具适配
部署教程
Ollama
官方无标签,可用社区 GGUF 或 modelscope 下载后转 GGUF;最简单用 vLLM/LMDeploy
LM Studio
LM Studio 加载社区 InternLM GGUF
llama.cpp
./llama-cli -m internlm3-8b-instruct-q4_k_m.gguf -p 提示词 -ngl 999
vLLM
pip install vllm && vllm serve internlm/internlm3-8b-instruct
智算工坊实验室
实测速度InternLM3-8B Q4 ≈38-42 token/s(RTX 3060)
显存占用8B Q4 约6GB;1.8B Q4 约1.5GB
功耗单卡满载约170W
不同 GPU 对比1.8B 在低端卡/CPU 均可;20B 适合 24GB 显存
常见问题 FAQ
InternLM3 与 InternLM2.5 选谁?
新任务选 InternLM3(新 tokenizer、更强代码和推理、Apache-2.0);需要 200K 长文档或 20B 参数选 InternLM2.5。
想在本地跑廉价方案?
InternLM2-1.8B 仅需约 1.5GB 显存,适合低端机器/手机端实验;8B 在 12GB 卡很流畅。
相关模型
相关工具
相关硬件
相关文章
数据来源
- https://huggingface.co/internlm/internlm3-8b-instruct
- https://huggingface.co/internlm/internlm2_5-7b-chat
- https://huggingface.co/internlm/Intern-S2-Preview-397B
- https://internlm.ai/