今日の注目トピック

強いmodelの暗号化traceを弱いsiblingへreplayしてdecode。公開6,708 trajectoryから31万超blockを復元、provider修正statusは未確認
LLM SecurityReasoning TraceReplay AttackSecrets

暗号化reasoning traceを弱いsibling modelへreplayし平文回収

これは何?reasoning traceはAIが回答へ至る内部推論で、APIは会話継続用の暗号化blockをclientへ返すことがあります。

Panfilov氏らはOpenAI・Anthropic・Googleの暗号化reasoning blockをsession・user・modelを跨いでreplayでき、同じproviderの弱いsibling modelをjailbreakすると強いmodelの推論を復元できたと報告しました。120件のCodeforces問題で復元長がhidden token数と近いことを示し、公開済み6,708 agent trajectoryから315,320 blockを再構成、非benchmark sessionでは704件のprivacy artifactを確認しました。64件はvisible sessionに現れず、provider別の修正statusは公開pageから確認できません。

なぜ重要か

暗号化はcontentの秘匿だけでなく、ciphertextを誰が・どのcontextで再利用できるかというauthorizationが必要です。agent traceを公開する際はvisible messageだけでなく、opaqueなsigned・encrypted blockもcredential相当として除去すべきです。

読むべき人
LLM API、AI agent platform、application security、trace公開pipelineの担当者
HN
432 points / 175 comments
guestはApple family 5相当・32KBを報告。process shimでfamily 9・64KB pathを選び、Gemma 4生成はbare metalの94.82%へ
macOS VMMetalllama.cppVirtualization

macOS VMのMetal capability報告を補正しllama.cpp生成を最大16倍高速化

これは何?Apple Virtualization.frameworkはmacOS guestからhostのApple GPUを使わせる仕組みで、applicationはguestが報告するMetal capabilityに応じてkernelを選びます。

CuaはTahoe guestが古いGPU family・32KB threadgroup memory・SIMD matrix非対応を報告し、llama.cppが遅いkernel pathを選ぶ原因を特定しました。process-scoped shimでfamily 9と64KBを返すと、M1 Ultra一台でTinyLlamaのprompt処理が11.08倍・生成が16.36倍、Gemma 4の生成が14.54倍になり、後者はbare metalの94.82%へ達しました。物理passthroughではなくprivate・version-sensitiveな挙動を使うresearch releaseで、MLX-LMには改善がありませんでした。

なぜ重要か

virtualized GPUの性能差はhardware割当そのものではなく、capability negotiationによるcode path選択から生じる場合があります。shimをproductionへ持ち込む前にhost・guest・applicationごとにAPI safetyと再現性を検証し、Appleのsupport範囲を確認する必要があります。

読むべき人
macOS virtualization、local LLM、Metal、computer-use agent基盤の開発者
HN
270 points / 43 comments
Mojo 1.0を告知するModular 26.5の公式画像
Modular
MojoProgramming LanguageGPUStability

Mojo 1.0、1.xの安定化契約とmemory safety診断を確立

これは何?MojoはPythonに近いsyntaxからCPU・GPU・accelerator向けの高性能codeを生成するsystems programming languageです。

ModularはMojo 1.0を公開し、1.xでは変更を原則additiveにする安定化方針を示しました。26.5は変数宣言をvarへ統一し、closureとPointer typeを一本化、Python風lambda、LSP改善、List.appendによるreference invalidationなどのmemory safety診断を追加しました。async model・pattern matching・unionは今後で、compilerとtoolchainは2026年中のopen source化を引き続き約束している段階です。

なぜ重要か

language adoptionではfeature数だけでなく、source compatibilityとtoolchain公開範囲がlibrary投資の判断材料になります。1.0はpackage ecosystemを固定可能にしますが、未実装roadmapと将来のbreaking change方針をproduction要件と照合すべきです。

読むべき人
GPU programming、compiler、HPC、systems language、AI infrastructureの開発者
HN
229 points / 105 comments
45M parameterをtraining-aware 2-bit化。14MB binary・28MB RAM・bounded contextでtool callし、低confidenceはcloudへ送る
On-device AITool CallingQuantizationEdge

Needle 2、tool calling特化45M modelを14MB・28MB RAMへ

これは何?Needle 2は会話全般ではなく、端末機能の選択・引数生成・schema付きdata抽出をlocal実行する小型language modelです。

Cactusは45M parameterのNeedle 2をCQ2-bitでtrainingし、model・tokenizer・grammar compilerをdependency-freeな14MB binaryへ統合しました。256-token sliding windowと固定tool sinkでsession RAMを28MBに抑え、Raspberry Pi 5で500 token/秒、Mobile Actionsで63.7% exact matchと提供者は報告します。汎用の230M〜3B modelとの比較には用途特化という非対称性があり、off-topicではempty callとconfidenceを返してcloud escalationを選ぶ設計です。

なぜ重要か

edge AIの成立条件をmodel accuracyだけでなく、bounded RAM・memory bandwidth・grammar enforcement・fallback policyまで一体で設計しています。製品採用では自社tool schemaでのfalse call、confidence calibration、2-bit比較条件を独立に再測定する必要があります。

読むべき人
IoT、wearable、robotics、on-device AI、embedded systemの開発者
HN
505 points / 169 comments
新modelのtextへ不可視mark、対応fileへC2PA署名。検出仕様は今後公開、存在も不在もauthorshipの確定証拠ではない
ClaudeWatermarkC2PAAI Act

Claude、新modelのtext watermarkとC2PA provenanceを世界適用

これは何?content markingはAIが処理したtextやfileへmachine-readableなsignalを付け、生成・編集のprovenance確認を助ける仕組みです。

AnthropicはEU AI Act Article 50のCode of Practiceに沿い、2026年8月2日以降にEUでlaunchするClaude modelへtext watermarkを埋め、対応画像fileへC2PA署名metadataを付けます。supported modelではAPI・Claude・Claude Code・cloud partnerを含め世界的に適用し、既存modelも移行予定です。検出方法の技術文書は未公開で、markは校正・翻訳にも付き得る一方、短文・強い編集・翻訳・metadata除去では検出できないため、authorshipやAI未使用の確定証拠にはなりません。

なぜ重要か

API consumerにもoutput保存・再配布・検出UIの設計変更が波及します。markをmoderationのhard gateへ使わず、false negativeとprocessed-not-authoredを表現できるprovenance signalとして扱う必要があります。

読むべき人
Claude API、content platform、provenance、compliance、AI policyの担当者
HN
411 points / 384 comments