LLM-jp-4 33B

日本大型语言模型研究开发中心(LLMC)于8月18日发布了拥有约332亿参数的Dense型大型语言模型“LLM-jp-4”系列新模型“LLM-jp-4 33B”。该系列包含两个版本:基础模型“llm-jp-4-33b-base”以及经过后期训练的“llm-jp-4-33b-thinking”。

“llm-jp-4-33b-thinking”模型在预训练和中间训练基础上,进一步进行了监督微调(SFT)和直接偏好优化(DPO)等后期训练。

而“llm-jp-4-33b-base”则完成了大规模数据的预训练和中间训练,适合作为针对特定任务进行额外训练或定制的基础模型。

通过使用评估框架“llm-jp-judge”进行测试,该模型在日本语MT-Bench、英语MT-Bench、AnswerCarefully以及llm-jp-instructions四个基准测试中,均超越了此前发布的LLM-jp-4 Thinking模型的成绩。

此外,随着模型的发布,LLMC还公开了用于DPO训练的数据集,供研究者和开发者使用。