W-02 / PROJECT DETAIL

AlbertLM

AlbertLM 是一个从随机初始化开始训练的约 1.745B 参数 decoder-only Dense Transformer 语言模型。项目覆盖数据构建、模型训练、继续预训练、监督微调、评测与推理,记录了一个个人语言模型从零构建到初步具备对话能力的完整工程过程。

AlbertLM / Recorded Inference

prompt: 你是谁

answer: 我叫AlbertLM,是一个独立预训练的语言模型。

以上是实际推理运行中保存的精选输入与输出。它们用于展示模型在具体问题上的表现,不代表模型的平均能力或稳定表现。不同样本可能来自独立的推理会话。

01

系统概览

AlbertLM 采用 decoder-only Dense Transformer 架构,包含 28 个 Transformer 层、2048 维隐藏状态和 6144 维前馈网络,注意力配置为 16 个 Query heads 与 8 个 Key/Value heads,词表大小为 81,920。

基础预训练阶段使用 2,048-token 上下文长度;监督微调阶段采用 4,096-token 上下文配置。

参数量
1,744,947,200
Transformer 层数
28
Hidden dimension
2,048
FFN dimension
6,144
Attention heads
16 Q / 8 KV
Vocabulary
81,920
PT context
2,048 tokens
SFT context
4,096 tokens
02

训练与评测

模型的主要训练工作在单张 NVIDIA RTX 5090 D v2(24GB)上完成,RTX 5060 Ti(16GB)用于部分推理与评测任务。

Formal32 基础预训练处理约 32B tokens,随后 Capability CPT 处理约 1.636B tokens,两阶段累计约 33.636B tokens,相当于约 19.3 tokens per parameter。这一比例接近常用于讨论 Chinchilla 式训练预算的约 20:1 经验比例,但不意味着已经证明该配置达到计算最优。

后续进行了监督微调实验:自建 SFT2 数据对应约 29.4M assistant-supervised tokens;SmolTalk 训练对应约 1.862B full-sequence tokens。两者统计口径不同,不能直接作为同一指标比较。

评测结果

在采用既定评测流程的 External-10 测试中,AlbertLM Base 与采用相近 Chinchilla 式训练预算的 Cognica-BP 1.3B 取得了接近的结果。这一观察仅限于该评测设置,不能据此推断两者的整体语言能力或对话能力相当。

监督微调后的 Instruct 模型已展现出初步的事实问答、助手角色响应和工具调用能力,但结果尚不稳定。模型仍会出现知识性错误、指令偏离、代码逻辑错误、上下文利用不足及重复生成等问题。

项目的重点是记录和展示一次独立完成的语言模型训练工程实践,而不是宣称已获得成熟的通用对话系统。

External-10 评测协议

External-10 是基于 lm-evaluation-harness 组织的十项公开基准组合,涵盖多学科知识、常识推理、科学问答及阅读理解等任务。评测采用 zero-shot 设置,最大上下文长度为 2,048 tokens,主要通过候选答案的条件对数似然进行判分。External-10 是本项目对这一组合的命名,并非独立发布的新基准。

  1. mmlu多学科知识
  2. hellaswag常识与情境续写
  3. arc_challenge困难科学问答
  4. arc_easy基础科学问答
  5. piqa物理常识
  6. winogrande常识及指代消歧
  7. boolq是非阅读理解
  8. openbookqa科学知识运用
  9. commonsense_qa常识推理
  10. social_iqa社会情境理解
评测后端
lm-evaluation-harness
Harness 版本
0.4.3
Few-shot
0(zero-shot)
最大上下文
2,048 tokens
模型
AlbertLM Base
判分方式
候选答案条件对数似然(likelihood-based)

External-10 宏平均

AlbertLM Base / Formal32 Final / step 244140
43.0408%
AlbertLM Base / Capability CPT Final / step 12483
42.2349%
Cognica-BP 1.3B
43.5141%

口径:External-10,lm-evaluation-harness 0.4.3,zero-shot,十个公开任务等权宏平均;各任务优先取 acc_norm,否则取 acc。

Capability CPT 后的变化:External-10 Macro 从 43.0408% 下降至 42.2349%,下降 0.8059 个百分点。其中 BoolQ 从 60.3364% 降至 52.7829%,下降 7.5535 个百分点,贡献了总体 Macro 净降幅的约 93.7%;其余九项有升有降,合计变化较小。二元判断任务中的答案倾向变化可能是相关因素,但尚无充分的逐题证据证明发生了整体预测翻转,因此不将其作为已确认的原因。

适用范围:结果仅反映上述十项任务、zero-shot 设置和 AlbertLM Base 在该评测流程中的表现,不代表模型的整体能力、中文生成能力或对话能力。

03

不足

AlbertLM 已经能够完成部分基础语言任务,但其能力仍受到模型规模、训练数据、后训练效果和推理配置等因素的限制。

  • 事实可靠性:能够回答部分常识问题,但也可能产生流畅而错误的解释。
  • 指令遵循:能够处理部分明确任务,但对输出格式、长度和条件约束的执行并不可靠。
  • 推理与代码:能够生成常见代码结构,但计算、条件判断、递归关系及示例结果可能不正确。
  • 上下文与生成稳定性:多轮对话、较长上下文、重复生成及结束时机仍存在问题。
  • 评测边界:精选样本和有限范围的基准测试不能代表模型的整体能力;不同 checkpoint 和推理设置下的结果也不应直接混用。
04

失败案例

以下是模型在指令遵循和代码生成任务中的两个真实失败案例。原始输出未经润色,错误说明仅针对对应样本,不代表模型在同类任务中的整体表现。

输出格式约束失败

prompt

请用三个词描述春天,不要添加其他内容。

answer
春天是季节,是春天的开始。春天是一个温暖、阳光明媚的季节,也是万物复苏、生长和发展的时期。春天是一个充满活力的季节,充满了生机与活力。春天是一个充满希望和希望的季节,充满了希望和希望。
错误说明

没有遵守仅输出三个词语的约束,还出现了明显的重复表述。

代码与示例输出不一致

prompt

请用 Python 写一个函数,返回字符串的长度。

answer
def length(s):
    return len(s)

示例:
```python
print(length("Hello, world!")) # 输出 3
```
错误说明

函数本身正确,但 "Hello, world!" 的字符串长度为 13,而不是模型所写的 3。这是示例结果错误,不能把整个函数判定为错误。

返回首页