输出格式约束失败
请用三个词描述春天,不要添加其他内容。
春天是季节,是春天的开始。春天是一个温暖、阳光明媚的季节,也是万物复苏、生长和发展的时期。春天是一个充满活力的季节,充满了生机与活力。春天是一个充满希望和希望的季节,充满了希望和希望。
没有遵守仅输出三个词语的约束,还出现了明显的重复表述。
W-02 / PROJECT DETAIL
AlbertLM 是一个从随机初始化开始训练的约 1.745B 参数 decoder-only Dense Transformer 语言模型。项目覆盖数据构建、模型训练、继续预训练、监督微调、评测与推理,记录了一个个人语言模型从零构建到初步具备对话能力的完整工程过程。
prompt: 你是谁
answer: 我叫AlbertLM,是一个独立预训练的语言模型。
以上是实际推理运行中保存的精选输入与输出。它们用于展示模型在具体问题上的表现,不代表模型的平均能力或稳定表现。不同样本可能来自独立的推理会话。
AlbertLM 采用 decoder-only Dense Transformer 架构,包含 28 个 Transformer 层、2048 维隐藏状态和 6144 维前馈网络,注意力配置为 16 个 Query heads 与 8 个 Key/Value heads,词表大小为 81,920。
基础预训练阶段使用 2,048-token 上下文长度;监督微调阶段采用 4,096-token 上下文配置。
模型的主要训练工作在单张 NVIDIA RTX 5090 D v2(24GB)上完成,RTX 5060 Ti(16GB)用于部分推理与评测任务。
Formal32 基础预训练处理约 32B tokens,随后 Capability CPT 处理约 1.636B tokens,两阶段累计约 33.636B tokens,相当于约 19.3 tokens per parameter。这一比例接近常用于讨论 Chinchilla 式训练预算的约 20:1 经验比例,但不意味着已经证明该配置达到计算最优。
后续进行了监督微调实验:自建 SFT2 数据对应约 29.4M assistant-supervised tokens;SmolTalk 训练对应约 1.862B full-sequence tokens。两者统计口径不同,不能直接作为同一指标比较。
在采用既定评测流程的 External-10 测试中,AlbertLM Base 与采用相近 Chinchilla 式训练预算的 Cognica-BP 1.3B 取得了接近的结果。这一观察仅限于该评测设置,不能据此推断两者的整体语言能力或对话能力相当。
监督微调后的 Instruct 模型已展现出初步的事实问答、助手角色响应和工具调用能力,但结果尚不稳定。模型仍会出现知识性错误、指令偏离、代码逻辑错误、上下文利用不足及重复生成等问题。
项目的重点是记录和展示一次独立完成的语言模型训练工程实践,而不是宣称已获得成熟的通用对话系统。
External-10 是基于 lm-evaluation-harness 组织的十项公开基准组合,涵盖多学科知识、常识推理、科学问答及阅读理解等任务。评测采用 zero-shot 设置,最大上下文长度为 2,048 tokens,主要通过候选答案的条件对数似然进行判分。External-10 是本项目对这一组合的命名,并非独立发布的新基准。
mmlu多学科知识hellaswag常识与情境续写arc_challenge困难科学问答arc_easy基础科学问答piqa物理常识winogrande常识及指代消歧boolq是非阅读理解openbookqa科学知识运用commonsense_qa常识推理social_iqa社会情境理解口径:External-10,lm-evaluation-harness 0.4.3,zero-shot,十个公开任务等权宏平均;各任务优先取 acc_norm,否则取 acc。
Capability CPT 后的变化:External-10 Macro 从 43.0408% 下降至 42.2349%,下降 0.8059 个百分点。其中 BoolQ 从 60.3364% 降至 52.7829%,下降 7.5535 个百分点,贡献了总体 Macro 净降幅的约 93.7%;其余九项有升有降,合计变化较小。二元判断任务中的答案倾向变化可能是相关因素,但尚无充分的逐题证据证明发生了整体预测翻转,因此不将其作为已确认的原因。
适用范围:结果仅反映上述十项任务、zero-shot 设置和 AlbertLM Base 在该评测流程中的表现,不代表模型的整体能力、中文生成能力或对话能力。
AlbertLM 已经能够完成部分基础语言任务,但其能力仍受到模型规模、训练数据、后训练效果和推理配置等因素的限制。
以下是模型在指令遵循和代码生成任务中的两个真实失败案例。原始输出未经润色,错误说明仅针对对应样本,不代表模型在同类任务中的整体表现。
请用三个词描述春天,不要添加其他内容。
春天是季节,是春天的开始。春天是一个温暖、阳光明媚的季节,也是万物复苏、生长和发展的时期。春天是一个充满活力的季节,充满了生机与活力。春天是一个充满希望和希望的季节,充满了希望和希望。
没有遵守仅输出三个词语的约束,还出现了明显的重复表述。
请用 Python 写一个函数,返回字符串的长度。
def length(s):
return len(s)
示例:
```python
print(length("Hello, world!")) # 输出 3
```函数本身正确,但 "Hello, world!" 的字符串长度为 13,而不是模型所写的 3。这是示例结果错误,不能把整个函数判定为错误。