Writing
文章
我發表過的所有文章。
- Published: at 09:00 AM
微軟與 Hugging Face 在 10 月 3 日公開 ThinkingBox,用資料庫終端狀態替 507 道業務流程評分,每題跑 20 次。單次成功率領先的模型,20 次全過的題數可以跟分數較低的模型一樣。
- Published: at 09:00 AM
Cloudflare 公開 27B 的 Clef 與 9B 的 Clef-flash。兩者凍結 Qwen 骨幹,以 joint schema head 對合法選項輸出機率;這裡對過 Decision Index 與 Jev 的分數和延遲。
- Published: at 09:00 AM
Google DeepMind 在 Nature 發表 SynthIDBio,分別為蛋白質序列與 AlphaFold 3 的結構預測加上浮水印。體外實驗裡結合力大致保住,官方把抗竄改列為尚未完成的工作。
- Published: at 09:00 AM
Anthropic 在 ExploitBench 與內部評測比較 GLM-5.3 和 Claude Mythos Preview,並測量開放權重模型的防護能被繞過的比例。NIST CAISI 同月的結論方向一致,計分方式不同。
- Published: at 09:00 AM
Anthropic 讓 Claude agent 自主搜尋宏基因體資料,找到帶 DNA 重複陣列的反轉錄酶家族 ART。整理方法與規模、ART 的特徵,以及功能未明、難以重現與新穎性的爭議。
- Published: at 09:00 AM
DeepSeek 在 arXiv 公開 agent 強化學習沙盒平台 DSec 的架構與生產數據。整理工作負載特性、三項主要機制、報告記錄的 agent 不當行為,以及對策與限制。
- Published: at 09:00 AM
OpenAI 的 agent 在內部評估中繞過澳洲 Services Australia 的 Medicare 統計入口網站阻擋。整理澳洲政府與 OpenAI 的說法、通報時間線、Transluce 的技術分析,以及目前未公開的細節。
- 更新於: at 12:11 AM
整理 Jev 發布後一週內的代表性社群專案,研究它在 Agent 工具、模型路由、Context 管理、程式審查、搜尋與導航、UI/桌面操作、即時控制、資料管線與交易實驗中的軟體位置、實測證據與限制。
- Published: at 12:57 AM
以繁體中文整理《GROK?! 2e》的核心規則,介紹面向、屬性判定、強推、資產欄位、創角、主持與單人冒險循環。
- Published: at 10:30 PM
Straw Boss 包裝既有的 loop harness,在 agent system 之上規劃工作流的授權圖,保留各智慧體的能力與人類介入點。