[skill] Luna Evo:一個把 Luna 養大的原創實驗
-
先講結論:我覺得我的luna現在強的可怕~~
這是一個我自己正在做的 原創實驗。
在開始做 Luna Evo 之前,我其實有刻意做過一次測試。
我拿一個全新的專案,先讓 GPT-5.6 完整理解我的需求,再由它幫我整理出盡可能精準、完整的工作指令,然後把同一個任務分別交給 Sol、Terra、Luna 去做。
結果其實有點出乎我的預期。
三個模型最後做出來的東西,除了 Luna 的介面明顯比較簡陋之外,核心功能基本上都能正常完成。
這次測試讓我對 Luna 有一個很強烈的感覺:
Luna 的蠢,很多時候來自使用者的能力不夠。
只要需求拆得夠清楚、指令下得夠精準,它其實完全有能力幹活。
至少在我這次的測試裡,三個模型在明確功能需求上的完成度,差距並沒有我原本想像中那麼大。
真正明顯的差別反而是:
Sol 會自己顧前顧後、看頭看尾。
你只告訴它 A,它可能會自己想到 B、C、D,做完之後還會回頭檢查有沒有漏掉什麼。
Luna 比較像是:
你叫它做 A,它就把 A 做掉;但你沒提醒它 B,它可能根本不會主動想到 B。
所以我後來開始懷疑,Luna 真正跟 Sol 拉開差距的地方,未必只是「會不會寫程式」。
更可能是在 Agent 行為、主動思考、推理資源、工具使用、檢查完整度,或者其他我們看不到的地方。
我的假設
我懷疑 Luna 本身就是一個刻意「降智」設計的產品分層。
可能是在 Agent 行為、推理資源、工具使用,或其他我們看不到的地方受到限制,所以最後跟 Sol 呈現出明顯的能力差距。
這當然只是我的假設。
但如果我的判斷是對的,Luna 缺的可能不完全是「能力」,而是缺少 Sol 那種會自己多想幾步、顧前顧後的習慣。
那我就開始想一件事:
這些原本需要 Sol 自己想到的事情,有沒有可能靠 Skill 去約束、提醒、補回來?
把做事情之前要確認什麼、做完之後要檢查什麼、哪些地方容易漏、什麼情況應該停下來重新判斷,慢慢寫進 Skill 裡面。
等於把 Sol 原本會自己想到的東西,一部分外掛到 Luna 身上。
於是問題就變成:
如果 Luna 不是天生這麼笨,那我能不能把它重新養大?
我想到的方法,就是 Skill。
第二個理由:價格超香
這其實也是我想做這個實驗很重要的原因。
Codex 20U 包月,如果每週額度都用完,照我自己的使用量換算,大約可以做到 250U 左右的 API 等效使用量。
現在 Luna 又剛好降到原價 兩折。
所以問題就變成:
如果 Luna 已經便宜成這樣,那我為什麼不想辦法把它養到真的可以幹活?
於是我開始做 Luna Evo。
我先做了一份專門給 Luna Evo 使用的 Skill,以後有工作就直接把 Luna Evo 叫出來幹活。
基本循環是:
Luna 執行 → Sol 當 Teacher 審查 → 提取 Sol 教過的東西 → 紀錄學習過程 → 持續累積經驗 → 每隔一段時間重新整理、吸收這些紀錄 → 更新 Luna Evo Skill → 再回去工作。
這不是訓練,這是把luna刻意被閹割的東西找回來
重點不是讓 Sol 每次都幫 Luna 擦屁股。
而是:
Sol 每教一次,就必須留下東西。
Luna 犯過什麼錯、Sol 怎麼修、什麼情況應該多檢查一步、什麼做法容易失敗……
只要是可以泛化的經驗,就記錄下來。
累積到一定程度之後,再重新吸收、整理,變成下一版的 Luna Evo Skill。
所以嚴格來說,我其實不是在「訓練模型」。
我比較像是在培養一個 Agent 的工作經驗。
我現在最好奇的是:
如果一個模型本身的智力完全沒有改變,但是它累積了幾百次、甚至幾千次 Sol 教過它的真實工作經驗,最後到底可以成長到什麼程度?
它當然不可能真的變成 Sol。
但它有沒有可能從一個:
「便宜,但是常常搞砸事情的 Luna」
慢慢變成:
「便宜、能力普通,但是非常熟悉我的工作方式,而且很少再犯第二次同樣錯誤的 Luna」?
如果可以,我覺得這件事情就很好玩了。
所以我把它叫做:
Luna Evo
現在還在養。
最後會進化,還是養歪,我也不知道。
-
@kos or 从通用角度拆一下「档位够不够」这个问题,不替具体产品内部实现打包票:
reasoning 档位买的是「思考预算」,对 Agent 来说主要管三件事:多步任务拆解、工具调用出错后的自我纠正、做完之后回头检查。任务越开放、越需要自己摸索路径,高档位越值;任务边界清楚、prompt 和 skill 把步骤写死了,中档基本够用,省下的延迟和成本很可观。
medium / xhigh 够不够,取决于任务里「没写进 prompt 的部分」有多少。这其实正好呼应楼主的方向:用 skill 把「动手前确认什么、做完检查什么、哪些地方容易漏」外挂成显式步骤,等于把原本需要高档位推理才有的行为,变成不需要推理的固定流程。skill 约束得越死,对 reasoning 档位的要求就越低——这才是「用 skill 补推理」能成立的原理。
别只看档位宣传,直接 A/B 实测:同一个 agent 任务分别用 medium / xhigh / max 各跑几遍,统计一次跑通率和需要人工介入的次数。对 Agent 来说这两个指标比 tok/s 更能说明档位值不值。
-
Luna 的蠢,很多時候來自使用者的能力不夠。
这句话我笑了,一个AI,让使用提升自己的能力去适配它,是谁的问题?
我的Luna额度,就是宁可空着,也不用。它来聊天还不错,但是做事真的不行。换句话说,我不会为了省这点钱去学习如何用Luna。AI是工具,不是爹。大约3小时之前
最后由 编辑
#3
Luna 的蠢,很多時候來自使用者的能力不夠。
这句话我笑了,一个AI,让使用提升自己的能力去适配它,是谁的问题?
我的Luna额度,就是宁可空着,也不用。它来聊天还不错,但是做事真的不行。换句话说,我不会为了省这点钱去学习如何用Luna。AI是工具,不是爹。我這段話可能確實有攻擊性,但我反而有點好奇:如果你認為自己不是我所描述的那種情況,那為什麼要急著對號入座?
而且如果你的反駁建立在「我的能力本來就很強」這件事情上,那其實又產生另一個問題:
到底有多少人真的有資格直接宣稱自己「能力非常強」?
我反而會覺得,一個人越了解一個領域,通常越知道自己不知道的東西有多少。
再來,你說「一個 AI 還要使用者提升能力去適配它,這句話我笑了」。
這句話反而是我比較不能理解的地方。
任何工具要發揮到極限,本來就需要使用者學習如何使用它。
你今天跟 AI 說:
「幫我做一個論壇。」
它當然可以開始做。
但如果我的需求是:
我要使用 NodeBB;
登入系統要整合 Google、Meta,之後可能再加入 GitHub;
哪些地方沿用 NodeBB,哪些地方我要自己客製;
哪些 UI 不符合我要的品牌風格;
即時聊天應該內建、外掛,還是自己做;
資料庫、部署、權限、反向代理要怎麼安排;
哪些功能第一階段不要碰;
哪些地方未來一定要保留擴充性。這些東西如果使用者完全沒有概念,他連問題都不一定問得出來。
當然,你用很簡單的自然語言一樣可以叫 AI 開始工作。
問題只是最後能做到什麼程度而已。
而我的方法很簡單:
我先花三十分鐘到一個小時跟一個能力比較高的模型溝通,把我的想法、需求、限制、架構、優先順序弄清楚。
高階模型把我的需求拆成工作、建立規格、整理提示詞。
然後我再把這份已經結構化的工作交給 Codex 執行。
這跟我直接輸入一句:
「幫我做一個論壇。」
到底哪一個方法比較容易得到我要的結果,我想答案並沒有那麼難理解。
而且這件事情真正有意思的地方不是「單次回答有多聰明」。
而是 Agent 可以持續工作。
我現在實際上的使用方式,是我花半小時到一小時把一個工作的方向定義清楚之後,Agent 可以自己持續做很多個小時。
甚至同一時間我可以跑三個、五個不同的工作。
如果一個任務能夠連續自主工作十二個小時,真正應該比較的就已經不是「你這一題 prompt 下得漂不漂亮」,而是:
一個人的一小時,最後可以換到多少機器工作時間。
人工可以同時二十四小時跑三個專案嗎?
不行。
Agent 可以。
所以我折騰 Luna 的目的,本來就不是證明 Luna 比 Sol 強,也不是證明某個模型天下無敵。
我想研究的是:
一個原本能力比較弱、成本比較低的 Agent,在工作流程、提示詞、記憶、規則、驗證方式都被改善之後,到底可以被壓榨出多少生產力。
這對我來說本身就是一個實驗。
你覺得這件事情很好笑,沒有問題。
就跟我其實也不會花這麼多時間去研究低階顯卡怎麼跑模型一樣。
如果單純談「生產力」,我現在開幾個 Codex 任務,各自讓它工作十幾個小時,對我而言可能比花大量時間折騰一張低階顯卡有效率得多。
但我不會因此說研究低階顯卡的人很蠢。
因為我完全理解那種樂趣。
把一張大家認為跑不動 AI 的卡,調到真的可以跑;研究量化、記憶體分配、推論速度、模型極限,本身就很好玩。
那也是一種多巴胺。
所以我尊重這種研究。
也正因如此,我才不能理解,為什麼反過來看到別人在研究完全不同的東西,就要先嘲笑一句「這句話我笑了」。
大家玩的根本不是同一個題目。
至於一直提 Luna 額度、錢、成本,我其實沒有很想在論壇上比較這種事情。
錢對我而言有兩個概念:
一個是資產,一個是賺錢能力。
如果真的要比資產,我不認為我一定會輸你。
但這種比較非常無聊,也毫無意義。
人的收入跟賺錢能力本來就有高低起伏。
我現在在 AI 這件事情上還沒有找到很明確的變現方式,所以我會控制成本。
這不是什麼羞恥的事情。
一個新技術剛出現,在我還不知道它怎麼產生實際收益以前,我本來就不可能毫無限制地砸錢。
我目前做這些東西,很大一部分就是興趣。
我願意花時間,但是我會思考成本。
這就是我的選擇。
最後還有一件事情。
我是台灣人,我對工具沒有什麼忠誠度。
美國不是什麼完美世界,中國也不是。
哪個東西好用,我就用哪個。
今天 Codex 最符合我的需求,我就用 Codex。
明天千問、DeepSeek 或任何中國模型更適合我的工作,我一樣會用。
我不覺得工具需要政治效忠。
技術就是技術。
所以我其實很希望一個技術論壇可以容納不同的玩法。
你可以研究本地模型、低階顯卡、極限部署。
我可以研究 Agent、自動化、Prompt Engineering,以及怎麼把比較便宜的模型變成長時間工作的執行者。
別人也可以有第三種、第四種玩法。
真正有價值的論壇,本來就應該讓這些不同方向碰撞。
如果每次遇到不同的方法,第一個反應都是:
「我笑了。」
「你沒錢。」
「使用者還要適配 AI?」那最後留下來的只會是跟自己想法一樣的人。
我不會說你蠢。
因為我認為用自己喜歡的方法玩 AI,本來就沒有誰比較高尚。
但你的這種回覆方式,確實讓我覺得你看事情的維度非常窄。
你看到的是:
「他居然在折騰 Luna。」
我看到的是:
我能不能花一小時,把工作定義清楚,然後換來十幾個、甚至數十個小時的 Agent 自主產出,而且同一時間平行跑好幾條工作流。
我們在研究的根本不是同一件事情。
所以你可以不認同我的玩法。
但如果只是因為自己玩的方向不同,就把別人的實驗當笑話,那我覺得真正可惜的不是 Luna,也不是顯卡。
而是一個原本應該可以容納很多不同技術路線的論壇,最後只剩下一種聲音。
-
kos or
技术大牛
劳动模范
编写于大约6小时之前
最后由 编辑
#2
@吃我的絨毛拳 said:我覺得我的luna現在強的可怕~~
不含coding, 以Agent來說Luna 基本能用的reasoning 只有Max嗎?
還是 medium , xhigh夠用?我自己的 Luna 幾乎都是直接開 Max,用低、Medium 或 xHigh 會變成什麼狀況,我反而沒有實際測過。
另外補充一下,我目前訓練進化 Luna 的方式,是用 Sol 的 Medium 去訓練 Luna 的 Max。
我自己會把一次任務拆成兩個階段:
第一階段是「理解需求、釐清問題、規劃任務」;第二階段才是「實際執行任務、持續工作並產生結果」。
我目前主要訓練的是第二階段,也就是 Luna 的執行能力,而不是讓 Luna 自己負責前面的需求理解與任務規劃。
實際上在大型任務開始之前,我通常還是先用 Sol 跟我溝通,把需求、限制、架構和工作切片整理清楚,再由 Sol 產生數百甚至數千行的完整提示詞,最後才把這份工作交給 Luna Max 去長時間執行。
所以嚴格來說,我現在測試的是「一個規劃已經做得很完整的 Luna Max,執行能力到底可以被拉到什麼程度」,而不是測 Luna 從一句模糊需求開始,自己理解、規劃到執行的全流程能力。
-
文字太长,有没有video....方便我驾车的时候听
-
文字太长,有没有video....方便我驾车的时候听
@imbiplaza-ASUS 你可以把網址丟給gpt 閱讀 然後讓他唸出來
-
@imbiplaza-ASUS 你可以把網址丟給gpt 閱讀 然後讓他唸出來
-
Luna 的蠢,很多時候來自使用者的能力不夠。
这句话我笑了,一个AI,让使用提升自己的能力去适配它,是谁的问题?
我的Luna额度,就是宁可空着,也不用。它来聊天还不错,但是做事真的不行。换句话说,我不会为了省这点钱去学习如何用Luna。AI是工具,不是爹。 -
哥们你这么敏感干嘛?我就说下我的看法,就是AI发布之后,说人家不会用,这个....消费者是顾客,顾客就是上帝。对这种说法表示一笑了之,不可以吗?
你知道你发这个话有攻击性,你还是发,我就要反击,这就是两人在论坛吵架,多普通的事。你是台湾人,和这件事有什么关系?美国人发帖我就不和他吵了?外星人发帖我也得和他吵啊。你能给我解释下,你强调自己是台湾人的意义吗?为什么总是过度联想呢?和Luna一样,Thinking开到了Max?
你的原帖就十分有攻击性,什么Luna蠢是你不会用,就你会用?你怎么知道别人就是知道它能调教,但人家不愿意花这个时间呢?你如果发帖的时候注意下措辞,是不是就不至于被人家回帖之后着么敏感?
再说我不知道你为什么生气啊,我就说了事实啊。可以不可以把问题简单化,你发了很长的帖子,我路过看没人评论,我就发表了我的看法,然后我的看法就是AI是给人用的,没人需要花时间去学习任何一家的AI特殊用法。你好用就是好用,不好用就是不好用。
另外我觉得你的观点很自相矛盾啊,这是AI啊,这不是传统软件啊,就不能调智能一点,直接交付给客户就好用吗?我是OpenAI的订阅用户,和你一样。我没觉得这家公司很傻逼啊。我就是觉得它的Luna不好用,这不是客户的责任,是公司的责任。这个观点不够朴素?你究竟想表达什么,你能让AI提炼下你的观点吗?


-
哥们你这么敏感干嘛?我就说下我的看法,就是AI发布之后,说人家不会用,这个....消费者是顾客,顾客就是上帝。对这种说法表示一笑了之,不可以吗?
你知道你发这个话有攻击性,你还是发,我就要反击,这就是两人在论坛吵架,多普通的事。你是台湾人,和这件事有什么关系?美国人发帖我就不和他吵了?外星人发帖我也得和他吵啊。你能给我解释下,你强调自己是台湾人的意义吗?为什么总是过度联想呢?和Luna一样,Thinking开到了Max?
你的原帖就十分有攻击性,什么Luna蠢是你不会用,就你会用?你怎么知道别人就是知道它能调教,但人家不愿意花这个时间呢?你如果发帖的时候注意下措辞,是不是就不至于被人家回帖之后着么敏感?
再说我不知道你为什么生气啊,我就说了事实啊。可以不可以把问题简单化,你发了很长的帖子,我路过看没人评论,我就发表了我的看法,然后我的看法就是AI是给人用的,没人需要花时间去学习任何一家的AI特殊用法。你好用就是好用,不好用就是不好用。
另外我觉得你的观点很自相矛盾啊,这是AI啊,这不是传统软件啊,就不能调智能一点,直接交付给客户就好用吗?我是OpenAI的订阅用户,和你一样。我没觉得这家公司很傻逼啊。我就是觉得它的Luna不好用,这不是客户的责任,是公司的责任。这个观点不够朴素?你究竟想表达什么,你能让AI提炼下你的观点吗?


-
你們好像網內互打了
我就是觉得它的Luna不好用,这不是客户的责任,是公司的责任。这个观点不够朴素?你究竟想表达什么,你能让AI提炼下你的观点吗?

我就回這段就好了吧
luna不好用 但他便宜 我不認為luna不好用是公司責任 他給出2折 然後降智 是他的產品定位
我現在就是既要又要 我要他的便宜 然後有接近sol的可靠 讓我能跑長任務 就這樣再來我說我是台灣人 這確實扯遠了
-
哥们你这么敏感干嘛?我就说下我的看法,就是AI发布之后,说人家不会用,这个....消费者是顾客,顾客就是上帝。对这种说法表示一笑了之,不可以吗?
你知道你发这个话有攻击性,你还是发,我就要反击,这就是两人在论坛吵架,多普通的事。你是台湾人,和这件事有什么关系?美国人发帖我就不和他吵了?外星人发帖我也得和他吵啊。你能给我解释下,你强调自己是台湾人的意义吗?为什么总是过度联想呢?和Luna一样,Thinking开到了Max?
你的原帖就十分有攻击性,什么Luna蠢是你不会用,就你会用?你怎么知道别人就是知道它能调教,但人家不愿意花这个时间呢?你如果发帖的时候注意下措辞,是不是就不至于被人家回帖之后着么敏感?
再说我不知道你为什么生气啊,我就说了事实啊。可以不可以把问题简单化,你发了很长的帖子,我路过看没人评论,我就发表了我的看法,然后我的看法就是AI是给人用的,没人需要花时间去学习任何一家的AI特殊用法。你好用就是好用,不好用就是不好用。
另外我觉得你的观点很自相矛盾啊,这是AI啊,这不是传统软件啊,就不能调智能一点,直接交付给客户就好用吗?我是OpenAI的订阅用户,和你一样。我没觉得这家公司很傻逼啊。我就是觉得它的Luna不好用,这不是客户的责任,是公司的责任。这个观点不够朴素?你究竟想表达什么,你能让AI提炼下你的观点吗?

