ZGCM-1-7B

从零训练的 7.39B 稠密基座模型 · 数学推理 & 智能体搜索 · 中关村学院 / 中关村人工智能研究院

7.39B 稠密 256K 上下文 思考 / 直答 双模式 MIT 许可

交互式 Demo 状态

本 Space 的 Gradio 应用代码(app.py)已经写好并推送在仓库里,运行在 ZeroGPU 上。但 Hugging Face 规定:免费账号的 ZeroGPU 需要账号注册满 30 天, 本账号创建于 2026-09-15,因此硬件暂时未开通。

硬件开通后,只需把本仓库 README 里的 sdk: static 改成 sdk: gradio,这个页面就会变成可对话的模型 Demo。

关键成绩(256K SFT · thinking 模式)

97.13
MATH-500
75.00
AIME 2026
70.42
HMMT 2025
63.09
WebWalkerQA

在技术报告的 14 项推理评测中,7B–8B 同规模模型里平均排名第一;AIME 2024/2025、MMLU、 LiveCodeBench 等项仍低于 DeepSeek-R1-0528-Qwen3-8B 或 Qwen3-8B。

模型规格

架构Decoder-only 稠密 Transformer
参数 / 层数 / 隐藏维度7.39B / 32 / 4096
注意力27 层门控滑窗注意力(窗口 128)+ 5 层全局注意力
GQA32 查询头 / 8 KV 头,head_dim 128
最大上下文262,144 tokens(256K)
训练约 4.19T tokens 预训练 + 600B tokens 中训练(16K→64K→256K)+ SFT
精度 / 显存bfloat16,权重约 15 GB;ZeroGPU 48 GB 切片可容纳

本地 / Space 推理代码

模型自带建模代码,必须 trust_remote_code=True;只依赖 torch + transformers,不需要 flash-attn。

from transformers import AutoModelForCausalLM, AutoTokenizer

model_id = "zgcagi/ZGCM-1-7B"
tokenizer = AutoTokenizer.from_pretrained(model_id, trust_remote_code=True)
model = AutoModelForCausalLM.from_pretrained(
    model_id, trust_remote_code=True, dtype="bfloat16", device_map="auto"
)

messages = [{"role": "user", "content": "计算 17 * 23,并给出步骤。"}]
prompt = tokenizer.apply_chat_template(
    messages, tokenize=False, add_generation_prompt=True, enable_thinking=True
)
inputs = tokenizer(prompt, return_tensors="pt").to(model.device)
out = model.generate(**inputs, max_new_tokens=2048, do_sample=True, temperature=1.0, top_p=1.0)
print(tokenizer.decode(out[0][inputs["input_ids"].shape[1]:], skip_special_tokens=True))

相关链接