EN
返回档案库

档案库 · 产品创意 · 产品决策 · 2024

Cognition的Devin作为自主AI队友完成整个开发任务

Devin是一款AI软件工程师,能端到端规划、编码、调试和测试任务——在SWE-bench上创下当时13.86%的纪录。

Cognition AI

创意是什么从副驾驶转向队友:由AI全权负责一个任务,从规划、在自己的终端和编辑器中写代码、运行测试到修复问题,端到端完成。伤筋动骨

当时的题目

Coding assistants like GitHub Copilot generated snippets, but planning, debugging and testing still fell on the human. Cognition set out to build an agent that completes whole engineering tasks and reports back.

它是怎么成立的

到2024年,AI编码工具已统一为一种形态:自动补全或聊天副驾驶,在人类进行规划、运行和修复时提供代码建议。Cognition是一家由竞技程序员创立的初创公司,它押注下一步不是更好的副驾驶,而是工程师。

Devin以自然语言接收任务,在一个沙盒计算环境中工作,拥有自己的终端、代码编辑器和浏览器。它制定逐步计划,编写和编辑代码,运行测试,修复问题,并实时发布进度;人类可以随时通过聊天界面介入并重新调整方向。

该公司展示了Devin端到端完成工作——部署应用、修复bug,甚至接受Upwork项目——并报告在SWE-bench的真实GitHub问题上达到13.86%的解决率,无需人工协助,而Claude 2为4.80%,GPT-4为1.74%,且这些模型还需要文件提示。

妙在哪

  • 这个想法重塑了产品类别:AI不是辅助人类编码员,而是拥整个任务,人类进行监督。
  • 给Devin自己的终端、编辑器和浏览器意味着它使用真实的开发者工具,而非预设补全。
  • 实时发布进度让人类能随时掌握情况,而无需等待最终结果。
  • SWE-bench的结果使自主性变得可衡量——端到端解决13.86%的真实GitHub问题,而之前的最佳模型为4.80%。
  • 将Devin定位为“队友”使得营销从削减成本转变为委托苦力活。

做出来什么

On the SWE-bench benchmark Devin resolved 13.86% of real GitHub issues end-to-end with no human help, versus 4.80% for Claude 2 and 1.74% for GPT-4 — and Cognition introduced it in March 2024 as the first fully autonomous AI software engineer.

报道Introducing Devin

可以借走的

产品的下一步不是当前交互模式的更快版本,而是改变谁来做工作:AI成为执行者,人类成为审核者。

后来

Devin于2024年3月推出,早期访问限于特定用户,并获得了Founders Fund等提供的2100万美元资金。Cognition表示编码只是其计划构建的AI员工的“开始”,并将该产品视为人类监督而非执行计算机工作的缩影。

资料来源

发现哪里写错了?告诉我们。

轮到你了

你刚读完一个点子。把你手上的题目说出来,看看谁接过同样的题。

免费账号 · 3 次免费提问 · 不用绑卡

相关案例