从零训练的 7.39B 稠密基座模型 · 数学推理 & 智能体搜索 · 中关村学院 / 中关村人工智能研究院
本 Space 的 Gradio 应用代码(app.py)已经写好并推送在仓库里,运行在
ZeroGPU 上。但 Hugging Face 规定:免费账号的 ZeroGPU 需要账号注册满 30 天,
本账号创建于 2026-09-15,因此硬件暂时未开通。
硬件开通后,只需把本仓库 README 里的 sdk: static 改成 sdk: gradio,这个页面就会变成可对话的模型 Demo。
在技术报告的 14 项推理评测中,7B–8B 同规模模型里平均排名第一;AIME 2024/2025、MMLU、 LiveCodeBench 等项仍低于 DeepSeek-R1-0528-Qwen3-8B 或 Qwen3-8B。
| 架构 | Decoder-only 稠密 Transformer |
|---|---|
| 参数 / 层数 / 隐藏维度 | 7.39B / 32 / 4096 |
| 注意力 | 27 层门控滑窗注意力(窗口 128)+ 5 层全局注意力 |
| GQA | 32 查询头 / 8 KV 头,head_dim 128 |
| 最大上下文 | 262,144 tokens(256K) |
| 训练 | 约 4.19T tokens 预训练 + 600B tokens 中训练(16K→64K→256K)+ SFT |
| 精度 / 显存 | bfloat16,权重约 15 GB;ZeroGPU 48 GB 切片可容纳 |
模型自带建模代码,必须 trust_remote_code=True;只依赖 torch + transformers,不需要 flash-attn。
from transformers import AutoModelForCausalLM, AutoTokenizer
model_id = "zgcagi/ZGCM-1-7B"
tokenizer = AutoTokenizer.from_pretrained(model_id, trust_remote_code=True)
model = AutoModelForCausalLM.from_pretrained(
model_id, trust_remote_code=True, dtype="bfloat16", device_map="auto"
)
messages = [{"role": "user", "content": "计算 17 * 23,并给出步骤。"}]
prompt = tokenizer.apply_chat_template(
messages, tokenize=False, add_generation_prompt=True, enable_thinking=True
)
inputs = tokenizer(prompt, return_tensors="pt").to(model.device)
out = model.generate(**inputs, max_new_tokens=2048, do_sample=True, temperature=1.0, top_p=1.0)
print(tokenizer.decode(out[0][inputs["input_ids"].shape[1]:], skip_special_tokens=True))