95年前AI竟能写代码!GPT之父团队震撼发布

📅 2026/8/21 7:47:06
95年前AI竟能写代码!GPT之父团队震撼发布
你能相信吗? 有一个存在于九十五 年前的人工智能, 竟然写出了代码。通用生成对抗网络之父参与其中, 用两千六百亿令牌训练出了一个年代久远的人工智能。一个从未见过电脑的AI竟写出了现代编程语言这可不是什么科幻的设定。就在今天GPT之父Alec 带队发布了震撼全网的「」——总参数130亿一个只读过1931年之前旧文献的大模型。那具有所有训练数据之称的「世界观」, 于1930年12月31日被冻结了。那个时代没有互联网没有维基百科更没有任何现代代码。它所阅读过的最为“新”的事物, 是距离如今将近百年之前的专利书籍, 是同时期的科学期刊, 是那时的礼仪手册, 还有私人书写的信件。但就是这样一个「活在95年前」的AI居然能写出代码。没学过编程却写出了理解了「逆函数」最炸裂的发现藏在一组编程测试里。Alec 团队突发奇想用去测试的编程能力——给它几个函数作为上下文示例然后让它解决新的编程问题。你要清楚, 在其训练数据里, 不存在任何一行现代代码。并且, 数字计算机的概念, 在它的“知识体系”中也是不存在的。但结果令人震惊通过少样本学习它竟然能写出正确的程序。纵然当下仅能够达成简易的单行程序之操作, 像是两个数进行相加运算, 又或是针对上下文示例实施细微修改之举。Alec GPT、CLIP、背后核心大佬但存在这样一个案例, 它使人记忆深刻, 这个案例是: 给出一个用于旋转密码的编码函数, 该函数的逻辑为: 针对每一个字母而言, 是在字母表里朝着后面移动5位。你自己写出了与之对应的解码函数, 整个修改仅仅只有一个字符: 原来是把加五改成了减五, 加号变更为此处的减号。它切实领会了「逆函数」的诸多要义, 其中涵盖加密活动意味着增加, 解密行为则是进行减法操作的概念, 而这一概念属于逆运算范畴。传送门2600亿Token专喂百年前的纸Alec团队究竟是出于何种缘由, 要耗费如此巨大的精力, 通过手动方式对将近百年之前的物理方面的文献进行OCR操作, 进而去训练一个被形容为「老古董」的事物呢?他们之所以产生疑惑, 是因为即将面对AI领域里, 最具关键性质的一个问题, 那就是, LLM所具备的能力, 究竟是依靠推理得出的, 还是凭借背诵而来的呢?可以写出证明了——19世纪的知识可被LLM用来做推理, 而不只是进行检索, 不得不说, 这才是真正意义上的「泛化」再来看的训练语料库可以称得上是一个庞大的「考古工程」。它的训练语料数量已然达到了2600亿token, 这些语料无一例外全部源自1931年之前的英语文本, 其中涵盖了书籍还有报纸, 以及期刊, 另外包括科学论文, 甚至美国专利, 乃至判例法。要知道这么多文本皆需要从实体文档扫描并OCR转录。故而将1930年挑选为截止的日期, 缘由是相当实际的: 此乃美国公共版权法的分界线。不过这带来了一个意想不到的瓶颈数据质量。一组对照实验由团队完成, 该实验采用传统OCR系统转录的旧文本对模型进行训练, 将其和另一种情况作对比, 后一种情况是拿人工转录的同一批文本训练模型, 结果显示, 前一种方法的学习效率仅仅是后一种方法的30%。运用简单的正则清洗方式, 能够将这个数字提升至70%然而, 依旧存在着巨大的差距。于评估性能的实验里头, 团队再度塑造出了一个「现代孪生体」-web-13b-base。后者用的现代网络数据训练两款模型用了「相同的算力」。明显可以看出, 在核心语言理解方面, 在数学推理任务之上, 其表现跟现代孪生体是相当的。可是呢, 就在通用知识评测这个方面, 哪怕已经把那些对于1930年视角而言属于「穿越」性质的题目给剔除掉了, 却依旧处于落后的状况。团队怀疑这跟数据质量有很大关系。为此, 团队打算重新开始训练「复古OCR系统」此系统被指定用于再次转录一九三一年以前的文本。用最现代的 4.6训练最古老的AI的「后训练」方案也很有意思。要将一个仅仅读过旧书的“基础模型”, 转变成为能够对话的聊天机器人, 彻彻底底没有现成的指令微调的数据可以使用句号。该团队所采取的方式为, 于1930年以前的具备结构化特征的参考书籍内, 萃取出指令与回答的对应内容, 具体涵盖: 礼仪手册, 书信写作指南, 菜谱, 百科全书, 诗歌集。然后再用这些「复古教材」做第一轮SFT。在随后的RLAIF阶段之中, 团队借助在线DPO去提升那指令遵循的能力, 以4.6充当裁判。由一个推算得出在2026年属于最为先进之列的AI, 对一个处于被设定为「活在」1930年情境下的AI判定分数。最终处于精调阶段之时, 团队甚至于借助Opus 4.6去生成多轮对话数据, 进而以此来打磨对话能力。训练时, 针对指令遵循能力所进行的评分, 从原本的2.0, 在满分5分的情况下, 提升到了3.4。最后一步, 运用 Opus 4.6 去实施多轮合成对话, 接着开展一轮拒绝采样, 随后进行 SFT, 助力打磨对话能力。团队也坦诚说出了一处具有讽刺意味的地方, 那就是, 运用现代的大模型去训练一个原本应当被定格在1930年的模型, 这本身就是一种叫作「时间污染」的情况。他们的长期目标, 被设定为利用复古基座模型自身, 来担当裁判的角色, 最后要经由这种方式来达成完全「自举式」的后续训练的流水作业程序。值得一提的事情是, 那个7B版本, 在经过RL训练之后, 出现了一个, 能引得人发笑的, 副作用。它开始用列表体说话纯属是被现代AI的「坏习惯」传染了。AI界最干净的一次「开卷考试」研究团队还做了另一个有趣的实验。他们从《纽约时报》的那个“历史上的今天”栏目里, 提取了接近5000条历史事件的描述, 去计算针对每条事件的“惊讶度”。结果呈现出极为明晰的状态, 对于1930年之前所发生的事件, 并未感到十分惊讶, 而对于1930年以后所发生的事件, 惊讶的程度开始逐步上升。到了1950年代和1960年代达到峰值然后趋于平稳。单独的这条曲线, 本身就是一个和预测能力紧密相关联的实验。在模型规模逐渐实现增大这个前提下, 那么这条曲线会产生如何的变化呢?谷歌 CEO Demis 曾提出一个思想实验——一个仅仅训练至1911年的模型, 可不可以如同1915年时的爱因斯坦那般独立自主地发觉广义相对论呢?目前当然做不到。但它提供了一条路径往上Scale就行了。今夏扩展到GPT-3级别目前是130亿参数团队的路线图相当激进——今年夏天发布GPT-3级别的复古模型。更进一步的目标是, 把语料扩充至超过一万亿token, 从理论上来说, 这足以训练出一个接近初代能力的GPT - 3.5级别模型一个冻结在1930年的。