今日の注目トピック

同じbase modelのpost-trainingを拡大し、Terminal Bench 3.0は4.6→28.3、ExploitBenchは24.4→54.4。weightsは安全評価後に公開予定
GLM-5.3Coding AgentsCybersecurityPost-training

GLM-5.3、post-trainingだけでcodingとcyber能力を拡大

これは何?GLM-5.3はcodebase・terminal・toolを扱い、長いengineering taskを実行するZ.aiのcoding agent向けmodelです。

Z.aiはGLM-5.2と同じbase modelに対し、実行・検証可能な長期task環境と非同期RLを拡大してGLM-5.3を公開しました。提供者測定ではTerminal Bench 3.0が4.6から28.3、DeepSWE v1.1が46.2から66.9へ上がり、ExploitBenchも24.4から54.4へ増えたと報告しています。269 projectから専門家review後に2,436件の脆弱性を特定したという主張もありますが、weightsは安全評価とhardeningを終えるlaunch後2週間まで公開しない予定です。

なぜ重要か

実行環境とverifierを増やすpost-trainingだけでも、coding能力と攻撃chain構築能力が同時に伸び得ます。benchmark値をproduction能力と直結させず、weight公開前の安全評価、tool権限、sandbox、脆弱性開示手順を同じrelease gateとして扱う必要があります。

読むべき人
coding agent、AI platform、application security、model evaluationの担当者
HN
1035 points / 515 comments
暗号化inputを復号せず推薦・fraud検知・network異常検知・hotword検知を実行。計算overheadとhardware加速は継続課題
HEIRHomomorphic EncryptionPrivate AICompiler

HEIR、既存AI modelを暗号化inputのまま推論する形へcompile

これは何?HEIRはhomomorphic encryption用の中間表現とcompiler toolchainで、serverが元dataを復号せずAI inferenceを実行できるようにするGoogleのopen-source projectです。

Googleはpre-trained modelを暗号化input上で動くprogramへ変換するHEIR compilerを公開し、推薦、credit card fraud検知、暗号化network trafficの異常検知、hotword検知の4例を示しました。homomorphic encryptionはsecure enclaveのようなhardware trustではなく暗号学的にserverからplaintextを隠せますが、計算overheadがあり、手動最適化には暗号の専門性が必要です。公開例はsingle-thread CPUで測定され、hardware accelerator企業とのlatency改善は今後示す予定です。

なぜ重要か

機密dataをcloud inferenceへ渡す設計を、復号できるtrusted boundaryから、plaintextを持たないcryptographic boundaryへ変えられます。導入判断ではmodel変換の対応範囲だけでなく、single-thread latency、ciphertext expansion、key管理まで含むend-to-end cost測定が必要です。

読むべき人
privacy engineering、ML platform、finance・healthcare、compilerの担当者
HN
289 points / 171 comments
Waylandで現地承認なしの再接続、login画面、multi-monitorに対応。x86_64 Debian・Ubuntu限定のpreview
RustDeskWaylandRemote DesktopLinux

RustDesk、Waylandでlogin前から無人remote accessするpreview

これは何?RustDeskはclientとrelay serverをself-hostできるopen-source remote desktopで、Waylandでは画面取得と入力注入がdesktop security boundaryに制約されます。

RustDeskは初期設定後に接続ごとの現地承認を求めず、reboot後のlogin画面とmulti-monitorにも接続できるWayland向けpreview buildを公開しました。対象はx86_64のDebian・Ubuntu系で、standard releaseではなく実環境testを募集する段階です。安定後にFedora・Arch Linuxへ広げる予定で、他distributionや既存Wayland環境で同等に動く確認ではありません。

なぜ重要か

Waylandのconsent modelとlogin前remote supportの両立は、fleet運用で長く残ったgapです。preview評価では接続可否だけでなく、credential保護、display manager境界、権限昇格、session切替時のcapture範囲を確認する必要があります。

読むべき人
Linux desktop、IT support、fleet management、remote access securityの担当者
HN
228 points / 96 comments
直近約20,000 tokenは原文保持、古い履歴はgoal・progress・decisionのhandoffへ。compact直後はprompt cacheを再構築
PiContext CompactionPrompt CachingCoding Agents

Piのcompaction、直近2万tokenを残して古いagent履歴をhandoff化

これは何?PiはLLMへfile・shellなどのtoolを渡すcoding agentで、compactionはcontext windowに収まらない長いsessionを要約して継続する仕組みです。

Piは通常turnの終了時にcontext残量を確認し、overflow時はturn途中でもcompactionを行い、default約20,000 tokenの直近messageを保持して古い履歴だけを専用promptで要約します。要約はgoal・progress・decisionを残すplain text entryとしてsessionへ追加されるため、modelを替えても継続できます。system promptからprefixが変わるので従来のprompt cacheは失われますが、compaction後のrequestから新しいcacheが構築されます。

なぜ重要か

長期agentの継続性はcontext量だけでなく、何を原文で残し、何をhandoffへ圧縮するかで決まります。compactionの品質、cache再計算cost、未解決事項の脱落を別々に観測できる設計が必要です。

読むべき人
coding agent、LLM runtime、prompt caching、developer toolsの開発者
HN
202 points / 90 comments
既存harness合格2,638件を12 gateで再監査。39.5%にtolerance-free failure、62.1%にcontract違反
GPU KernelsLLM Code GenerationVerificationBlackwell

LLM生成GPU kernel、既存合格2,638件の39.5%に許容誤差外の欠陥

これは何?GPU kernelはtensor計算をGPU上で並列実行するprogramで、LLM生成系は通常、固定shapeの少数inputでreferenceとの近似一致を調べて正しさを判定します。

Rishi Shah氏とRishav Shrestha氏は値・gradient・shape・決定性・precision・NaN/Inf・hardware resourceを検査する12 gateのverifierを作り、既存harnessが合格させた2,638 kernelを監査しました。preprintは39.5%がtoleranceでは説明できない失敗を含み、62.1%に少なくとも1件のcontract違反があり、最多はNaNやinfinityを通常値へ変えるsilent corruptionだったと報告します。自作kernel 7件のpositive control、reference benchmark codeとの98.5%一致、hand auditで検証していますが、B200と特定corpusを対象とするv1研究です。

なぜ重要か

固定shapeのallcloseだけをrewardやrelease gateにすると、高速でもshape変更・非有限値・nondeterminismで壊れるkernelを正解として学習させます。生成kernelの評価はspeedと同列に、adversarial inputとtolerance-free contractをCIへ組み込むべきです。

読むべき人
GPU kernel、ML compiler、AI code generation、benchmark設計の担当者
HN
35 points / 0 comments