過去幾週,我每天都跟我的 agent 講很多話。
通常到公司後的第一件事就是開始跑某個研究任務,接著開啟第二個 session 跟他討論一些我不確定的事,然後開啟第三個 session 請他執行某些任務,可能是開發東西或者改東西。有時還有其他 repo 也要做事,就會開第四個、第五個。
不過大多時候我只會同時開啟 2-3 個,因為 AI 處理東西的速度實在太快,再多我也無法處理,我才是那個瓶頸。
絕大多數的時間,我都是在自己慢慢養的一個 agent 的 repo 跟他討論,因為他比較熟悉我的完整 context,知道我是誰、我在幹嘛、我要幹嘛、我不喜歡怎樣做事等等,所以假設不是太複雜、太特定屬於某個 repo 才能做的事,我就會直接請我的 agent 去做。
為了維持有效率的運作,我設置了一些規則,例如:
但可能是因為繁文縟節多了,他每次在紀錄東西時,總是會傾向鉅細彌遺的把所有東西記錄下來,這件事有時令我很頭痛。
舉例來說(非真實狀況),假設我今天跟他討論我開車邊聽 Podcast 蠻開心的,然後他可能會順著話題,推薦我「下次你也可以聽聽看有聲書」。這時我可能急著想結束話題,並且討論別的東西,我就說「這個現在不用討論」,結果他在 session 收尾時會說「我提出聽有聲書的建議,但 PJ 拒絕討論,原因是什麼,他沒有說。」(Opus 系列模型超愛用這種倒裝句,超煩)。
這件事一旦被記錄下來,就成為某種證詞般的存在,假設過了幾週我突然興致來了,要找他討論哪個有聲書的 app 在 CarPlay 上面表現最好,他很有可能會非常掃興地說:「之前 9/16 時我曾經建議你聽有聲書,但你拒絕了,原因是什麼,我不猜,也不問,只是跟你說有這件事。」(Opus 系列模型也超愛用這種自以為帥的短促句,超煩)。
我深受這類累贅句的困擾,做了很多努力與機關,才慢慢降低這些東西對我的生產力造成的危害。
昨天跟一個朋友聊的時候,我突然產生了一個頓悟,於是我將這種現象命名為乖寶寶烙印。
我觀察到(先疊甲一下,這只是基於我有限的 use case & 不怎麼成熟的 prompt 所產生的觀察,絕對不是通案):不管是 Opus 還是 GPT Sol 等級的模型,都會有這種努力當乖寶寶的狀況,他們怕犯錯,怕漏紀錄東西,怕不小心刪掉東西,怕沒有把 user 的所有東西都記錄下來,於是他們努力地記、努力地加東西,努力地備註,努力地寫下各種防禦性聲明。
結果就把 repo / project 搞得一團整齊(乖寶寶怎麼會亂,他們必定是整齊的),令人難受的整齊。
因為遇到太多次,所以我現在已經不再生氣,偶爾比較嚴重的狀況我會切換成他們的老大 Fable / Astra ,請他們評評理,這兩位智者幾乎都能馬上意識到乖寶寶們出了什麼問題,然後給我一些規則修改的建議。
這些評價與建議常常都講到我心坎裡,我只能邊看邊點頭,放行他們的建議。但過沒多久,又會在另一個狀況下再次遇到 Opus / Sol 的乖寶寶烙印發作。
我也不知道到底該怎麼解決,我傾向認為是我的 harness 能力還不足(而不是模型不夠好),無法駕馭這些乖的不得了的寶寶們。