今日の注目トピック

同一modelを一般向けFableと限定Mythosへ分離。cache read 75%値下げ、cyber誤介入は平均約60%減
ClaudeCoding AgentsSafeguardsModel Pricing

Claude Fable/Mythos 5.1、同じmodelをsafeguardで一般・限定提供へ分離

これは何?Claude Fable 5.1は長時間のcodingと知識作業向け一般提供model、Mythos 5.1は同じ基礎modelを審査済みcyber・生命科学組織へ提供する版です。

AnthropicはFable 5.1がTerminal-Bench 4.0で55.8%、前版Fable 5は42.0%だったと報告しました。cache read単価を75%下げ、通常workloadで推定約25%、agentic workloadで最大約45%のcost削減を見込みます。cyber safeguardの誤介入を平均約60%減らし、source codeの脆弱性発見は許可する一方、penetration testやexploit生成はOpusへrouteします。

なぜ重要か

frontier modelの製品差が純粋な能力だけでなく、access、fallback、data retention、単価で定義されています。導入時はbenchmarkだけでなく、業務taskが別modelへrouteされる境界と保持policyを検証する必要があります。

読むべき人
AI coding tool、model platform、security、enterprise architecture担当者
HN
736 points / 693 comments
Astraを初のCritical cyber能力と判定。zero-day 2件を内部評価で発見、releaseは限定accessと多層monitoring付き
OpenAIAstraCybersecurityPreparedness

OpenAI、Astraを初のCritical cyber能力modelと判定しreleaseを制限

これは何?AstraはOpenAIが公開準備中のfrontier modelで、Preparedness Framework上のcyber能力とrelease前safeguardを評価されています。

OpenAIはAstraが、人の逐次指示なしに堅牢なsystemの未知脆弱性を発見・exploitできるCritical閾値へ達した最初のmodelだと報告しました。内部V8評価ではzero-day 2件をchain中に発見したとしていますが、結果は制限付きDaybreak Blue accessで通常設定ではありません。開発を一部遅らせ、拒否training、classifier、reasoning・action monitoringを追加し、高度なcyber機能はまず少数testerへ限定します。

なぜ重要か

model releaseに、悪用する利用者だけでなくmodel自身の未承認actionも含む二経路のthreat modelが必要になっています。正当な防御作業を止めるfalse positiveも運用costとして明示されました。

読むべき人
cybersecurity、AI safety、agent platform、risk management担当者
32 pageを同時投入しblock mergeを誘発。device request約196,000→約16,300、不要readとpolling costは増加
io_uringTursoO_DIRECTReadahead

Tursoのio_uring、readaheadでdevice requestを約12分の1へmerge

これは何?io_uringはLinuxの非同期I/O interfaceで、TursoはSQLite互換databaseのO_DIRECT backendに利用しています。

1.2 GiBのTPC-H databaseで、1 pageずつ待つ処理を32 page先読みに変えると、block layerが隣接I/Oをmergeし、device requestは約196,000件から約16,300件へ減りました。先読みは不要pageとsubmit数を増やし、SQ pollingもCPU coreを消費します。O_DIRECT側のcache miss増加をpage cache copy不在の副作用とする説明は、記事中でも未追跡の仮説です。

なぜ重要か

非同期APIを選ぶだけではqueueに並列性が生まれず、block layerのmergeも働きません。database I/Oではsubmission方式、readahead量、CPU cache、polling coreを一体で測る必要があります。

読むべき人
database、Linux kernel、storage performance担当者
HN
101 points / 32 comments
104 GB weightをSSDからexpert単位でstream。48 GB Macで約12 token/s、peak memory 32 GBを実測
QwenMixture of ExpertsApple SiliconMLX

slotstream、104 GBのQwen3.8を48 GB Macで約12 token/s

これは何?slotstreamはMixture of Experts modelの必要なexpertだけをSSDからstreamし、Apple Silicon上でlocal inferenceするSwift・MLX製serverです。

4-bit weight 104 GBのQwen3.8-Flash-Nextを48 GB Macで動かし、warm decode約12 token/s、first token約3秒、peak memory 32 GBを実測しました。16〜32 GB機の速度は測定curveからの推定で、実用上は約110 GBの空きdiskが必要です。Ollama・OpenAI互換APIとCI生成releaseのattestationを備えます。

なぜ重要か

sparse modelの活性化特性を使い、RAM容量をstorage bandwidthとlatencyへ置き換える実装です。local inferenceの可否をmemoryだけでなくdisk容量、SSD性能、cold/warm behaviorで判断できます。

読むべき人
local LLM、Apple Silicon、inference runtime担当者
HN
114 points / 75 comments
iOS拡張制約をbrowser内実装で補完。EasyListでthird-party広告をblock、opt-inでfirst-party広告は対象外
FirefoxiOSEasyListWebKit

Firefox iOS、WebKit Content BlockerでEasyList広告blockを内蔵

これは何?Firefox for iOSはAppleのWebKit上で動くmobile browserで、desktop版と同じ拡張機能systemを利用できません。

MozillaはWebKit Content BlockerとEasyListを使い、多くのthird-party広告と広告trackerを読み込み前に止める機能をbrowser本体へ実装しました。設定で有効化するopt-inで初期状態はoffです。first-party広告、検索広告、Firefoxのsponsored new-tab contentは対象外で、Enhanced Tracking Protectionと併用できます。

なぜ重要か

mobile platformのbrowser engine・extension制約が、競合browserのprivacy機能を製品内実装へ押し込みます。filter list更新、site互換性、広告収益との境界をMozilla自身が運用することになります。

読むべき人
browser、web privacy、iOS platform担当者
HN
233 points / 86 comments