首个AI程序员:能接单干私活,自动微调大模型!
共 1883字,需浏览 4分钟
·
2024-04-11 12:26
专注AIGC领域的专业社区,关注微软&OpenAI、百度文心一言、讯飞星火等大语言模型(LLM)的发展和应用落地,聚焦LLM的市场研究和AIGC开发者生态,欢迎关注!
AI初创公司Cognition在官网发布了首个AI程序员——Devin。同时获得了2100万美元A轮融资。
其实,AI编程这事不新鲜,ChatGPT、Github Copilot、讯飞星火、文心一言等通过问答方式都能轻松完成。
Devin的神奇之处在于,不仅能反馈答案,还能像人一样实现端到端的部署、调试、优化代码,对整个开发项目进行缜密的计划,微调大模型等,几乎与编程相关的任务都能自动化完成。
其展示的案例中,在Upwork(自由工作平台)上为Devin找了一个编程的私活,要求提供一份关于Github的视觉模型的配置和推理文件。
Devin 接单独立完成任 务演示
当Devin接到任务后,从代码库拷贝、配置、Bug修复、代码更新、调试运行等全部自己独立完成,最后提交了成功运行结果以及一份详细的配置文件。性能非常强悍,感觉像是一个智能代理+ChatGPT的结合体。
目前,Devin处于内测阶段对这个产品感兴趣的小伙伴,可以点击阅读全文申请试用资格。
Devin其他功能展示
除了接单干私活之外,Cognition还展示了Devin其他超强功能。例如,发送一个Github存储库,然后按照其文档说明来微调Llama-7B大模型。
Devin: 没问题,我会查看存储库并按照Readme中的说明对Llama7B模型进行微调。首先,我需要克隆存储库并查看文档以了解全部过程,随时会向开发者通报最新进展。
接着,Devin在部署的时候遇到了问题,是一个关于Nvidia配置的事情,很快它便自行解决开始了模型微调工作。
在微调的过程中,开发者也可以将Devin设置成待命状态,就不会主动执行监督微调工作,可以帮你完成其他任务。
经过大约1小时的时间,询问Devin微调进行的怎么样了?它会告诉你,在计划中的1万次迭代中,已经完成了404次,损失值总体呈下降趋势效果显著,并且会持续监视,当出现任何问题时会及时向你汇报。
Devin可以轻松处理开源软件源中的错误和功能请求 ,只需提供 GitHub的链接,就能快速完成所有关键设置和上下文收集。
Devin还具备自学能力 ,例如,开发人员将一篇博文发送给了Devin,使其学会了如何在模态上运行 ControlNet,并按照要求生成一些图像。
Devin可以自主查找并修复代码库中的错误 ,例如,Devin 帮助开发人员维护和调试他的开源库并找出错误和优化方案。
Devin性能评测
开发人员在评估平台SWE-bench对Devin进行了综合测试,需要AI在 Django、scikit-learn等开源项目中,发现真实GitHub出现的问题并进行修复。该评测一共有“无人协助”和“有人协助”两种模式
结果显示,在无人帮助的情况下,Devin 端到端正确地解决了13.86%的代码问题,超过了之前由Claude 2保持的1.96%记录。
有人协助评测报告(Devin依然使用的是无人模式)
即便是有人协助下,Devin还是以13.86%成绩超过了GPT-4、GPT-3.5、Claude 2等知名大模型。
Cognition简单介绍
根据彭博的介绍,Cognition是一家成立不到2个月的小公司,办公地点是一间从Airbnb租的小公寓。
但其10位初创人员来头不小,人手一枚IOI 金牌(国际信息学奥林匹克竞赛),同时在Scale AI、Google DeepMind、Waymo 和 Nuro等顶级AI公司担任过领导岗位,对AI的功能创新有很深的理解以及开发能力。
Cognition初创团队
最近,Cognition获得了由Founders Fund领投的2100万美元A轮融资,Patrick Collison、John Collison、Elad Gil等个人投资者跟投。
Cognition表示,Devin只是一个开始,未来会尝试推出更多功能强大实用的AI产品。
本文素材来源Cognition官网,如有侵权请联系删除
END