search icon
勃勃OC

勃勃OC

o3-mini是专门在代码问题上微调的。r1同时在代码和数学题上微调。显然r1的代码能力不如o3-mini。这表明DeepSeek并没有魔法,数据决定模型,RL也是。

0/200

评论 0

暂无更多评论