在上一篇文章我們提到,chatGPT一上市立刻震撼整個世界。雖然之前在軟體業界,已經普遍存在用AI輔助程式碼撰寫的產品,但這還是第一次毫不保留地將AI的力量,全方位地展示在世界面前。
幾乎所有人都嘆服於AI的神奇,基本概念只源於「猜下個詞」的多參數語意大模型,竟然能生成出接近甚至於高於人類的跨領域智慧。
但許多人想更進階地巧妙運用大模型時,卻發現chat模式下的大語意模型,受到的侷限很大。在那個時代仔細研究過chatGPT的朋友,一定對當時不斷被發現、被推薦的Prompt海(提示詞)印象深刻。
還在chat模式下的我們,面對眾多的Prompt,卻甚至沒有一個好的手段來儲存、複用;與其對應的,chatGPT所生成的程式碼、文件、分析結果,我們也只能複製貼上到其他程式中另外儲存記錄,輸入與輸出都受到極大限制。
說不堪用太過誇張,但離好用易用也很遙遠。這個時間點的模式,其實就屬於「口耳相傳」,chatGPT就像是個坐輪椅的智者,他擁有世界上大多數的知識,但只能在聽你描述問題後,將可能的解法傳授給你,讓你嘗試去解決(比如把程式碼放進VScode跑看看,有錯誤再告訴他),而無法直接幫你處理。
雖然智者的智慧前所未聞,令我們驚嘆,且過一陣子又會繼續提高,但這種輸入輸出貼來貼去不夠便利也是事實---我們需要的明顯不僅於此。
直到某一天,某種被稱為Agent的概念橫空出世。自此,智者一臉獰笑地自輪椅上站了起來,順手把輪椅擰成麻花扔去當柴火燒,一邊手腳俐落地開始幫使用者砍柴、耕種、釣魚、打獵、挖井、製造工具、蓋房子…。
Agent是什麼?模型還是那個模型,為什麼它能大幅提昇生產力?
從字面上的理解,Agent就是代理人的意思,可以代替人類去做事的程式,就可以稱之為Agent。但在AI業界,Agent有更細緻的定義,它需要能自主完成「感知」->「思考」->「行動」的無限迴圈,學術上稱為「ReAct」架構(Reasoning and Acting)。
「感知」即感知環境,除了我們提供在聊天框的資訊(要求)外,Agent架構賦予的大模型「讀取」的能力,它能讀取檔案系統的log文件、程式碼,或是自己連接網路,使用API或讀取網頁查詢現況;當然除了環境狀態外,也能讀入文件內容作為Prompt。
「思考」除了理解使用者的要求與環境現況外,更重要的是以此兩者為輸入來規劃實施,大模型在背景推演達成目標的步驟以及分支,給自己列好一份待辦清單。如果在前一輪的行動失敗,重新開始時,AI也會重新「反思」,將剛剛的錯誤納入考量。
「行動」時,AI不再只能從訊息輸出框給出建議,而是直接按照實施步驟,接管使用權限,控制檔案系統實際解決問題。例如Agent可以自己打開終端機輸入指令,安裝程式語言,然後自己寫程式、debug,最後執行來解決問題。Agent的輸出,讓大模型不再需要透過「人」,而是自己就有能力影響現實世界。若需要向使用者回報,也不再僅能從聊天介面輸出內容,而可以自由選用各種類型的檔案並長期保存。
從chat到Agent,可以說是系統進化的必然。公眾認為不好用的地方,就是再度進化的起點。自Agent起,與大語言模型的對話不再需要每次都從起手式開始,先找出一堆Prompt與背景資料餵給AI,然後才進入流程;工作結束後,AI也可以自己記錄過程與結果,以便下次橫向擴展或定向深入,繼續研究。如果要譬喻的話,Agent就像人類文明史中「發明文字」一樣,從此人類文明的傳承,不再基於耆老的壽命與記憶品質,得到了更穩固的渠道去管理、發展共有的長期記憶。
無論是否有資訊方面的背景,Agent都很適合作為初入AI之門的起點,找到適合自己的平台,就如同在探索陌生的新環境時,搭配了一位優秀又極有耐心的副官,可以在此研究、學習、探索、分析、總結、嘗試。
我現在日常使用的Agent是Google推出的Antigravity(AG),它目前又可分為Antigravity 2.0與Antigravity IDE兩個版本,我稱之為黑A與白A,改天有機會再寫文章詳細介紹其區別與用法。
如果您還在尋找適合自己的Agent,不妨從AG先開始研究,待日後再更換成更適合自己的選擇。
其他的Agent諸如:Cursor、Windsurf、Claude Code、Codex、Cline、Aider、OpenHands、Void、Github copilot Workspace、Devin…等,也都符合前文所述的Agent特性,就是側重點各有不同,但無論您慣用哪種Agent都無所謂,本部落格相關內容都通用。