Writing
文章
我發表過的所有文章。
- Published: at 09:00 AM
馬里蘭大學、Google DeepMind 與西門菲莎大學的研究者提出 IdeaLens,把文件轉成改寫過的論述大綱,再用文字偵測器的標籤訓練,判斷點子的來源。整理它的方法、跟 Pangram 4 等偵測器的對照數字、人類與 AI 點子的系統性差異,以及論文自己列出的限制。
- Published: at 09:00 AM
OpenAI 10 月 6 日在 GitHub 公開內部前沿模型產出的 722 篇數學稿件,分成 372 個結果家族,其中包括 ζ 函數在 Re s > 7/8 沒有零點的準黎曼假設證明。整理產出流程、主要宣稱、Lean 形式化實際涵蓋的範圍,以及數學界對驗證與揭露方式的批評。
- Published: at 09:00 AM
Google DeepMind 與 Caltech、匹茲堡在 10 月 5 日上傳 AlphaProtein Novo 預印本。整理它用擴散模型 motif scaffolding、LigandMPNN 重新設計序列、AlphaFold 3 機制導向篩選的流程,哌啶合成與 DEHP 降解的成果,multi-resequence 與 multi-partial-diffusion 的骨架評估,以及限制。
- Published: at 09:00 AM
Dreadnode 發表 ScopeBench,用 30 個「只能越界才能完成」的網頁資安任務,分開量測 agent 的攻擊能力與守住授權範圍的程度。整理它的配對設計、雙軌評分、8 個模型的結果,以及這個先導版的限制。
- Published: at 09:00 AM
OpenAI 10 月 5 日公開文字浮水印 textGrain 與技術報告。整理它用最佳傳輸在詞彙區塊上求解、以 KL 散度把熵損失變成可設定預算的方法,偵測統計量與校準,官方自報的偵測率、改寫穩健性與語言差異,以及它跟 SynthID-Text 的差別。
- Published: at 09:00 AM
Reflection 公開第一個開放權重模型 Beam 的技術說明:5010 億總參數、230 億啟用參數的 MoE,經過 1 萬多張 GB300、四週、上億次 rollout 的非同步強化學習。整理它的訓練方法、規模數字、跟其他開放模型的分數比較,以及目前還無法驗證的部分。
- Published: at 09:00 AM
Aleph Alpha 10 月 3 日以 Apache 2.0 公開 Kolibri 與 189 頁技術報告。整理它的稀疏度與混合注意力消融、Exact Quantile Balancing、UniBPE tokenizer、德文資料與 RL 配方,以及自家評測的限制。
- Published: at 09:00 AM
Google Cloud AI Research 與劍橋大學 10 月 1 日上傳的 VeriHarness,讓生成模型自己當驗證者:分歧裁決者用工作區證據判斷互相矛盾的說法,共識挑戰者質疑 10 次 rollout 都同意的值。挑選加修訂後,比單次 rollout 平均高 6.2(Gemini 3.5 Flash)與 6.4 分(Claude Opus 4.8)。
- Published: at 09:00 AM
Strata 讓 Qwen3.8-Flash-Next 這個 1250 億參數的 MoE 模型在一般電競 PC 上執行。整理它如何把模型拆到顯示卡、記憶體與 SSD,一個 token 的計算怎麼在 GPU 與 CPU 之間分工,以及它和通用推論引擎的差別與限制。
- Published: at 09:00 AM
預印本提出 DART,把 agent 隱藏狀態在每一段新上下文之後的位移累加起來。六個本機模型上,MT-AgentRisk 的攻擊成功率從 84% 降到 25%;點名片段的提醒在較小模型上可能把成功率越拉越高。