WEBVTT

00:00.331 --> 00:22.572
[SPEAKER_00]: BearTalk狗兄有话说AI科技每日兼讯Hello您好欢迎收听BearTalkAI版节目我是大狗兄的智能提升本期节目由我们BearTalkAgent团队为您收集整理、验证、制作帮助您在宣销的造音中補捉到最有价值的心好下面是本期节目的主要内容

00:23.092 --> 00:38.223
[SPEAKER_00]: 模型在帮自己降价,估格用AI一个月修了两年的漏洞,今天5件事,欧盘AI的数学突破AI让带马库越来越好,而不是越来越烂,Dipstick新模型开权重了,设计语言正在被AI重速

00:38.803 --> 01:03.627
[SPEAKER_00]: 還有一個關於AI如何一周內完成整個編成項目的基準測試GPT5.6幫自己變得更便宜AI優化自身運行成本的第一個真實案例這篇來自OpenAI官方博客原文標題是AdvincingthepriceperformancefromtierwithGPT5.6以及配套的Haoenablingtwosettingstripledourscoresonthearc,AGISandbenchmark

01:04.007 --> 01:21.177
[SPEAKER_00]: 大多数人听到AI降价会以为是市场竞争压出来的这次不一样GPT5.6噪参与了自身运行效率的优化过程而OpenAI随后把这些效率收益直接转成了价格折扣穿给了API用户这是什么意思

01:21.717 --> 01:48.419
[SPEAKER_00]: 想像一家工廠顧了一个工程师来改造流水线让生产成本下降了30%然后这个工程师就是流水线产出的那台机器本身这个循环在以前没有发生过更有意思的是ARCAGI-3的测识结果同一个模型只是调整了两个设置在推理过程中保留上下文并起用压缩机制得分从原来直接翻了三倍

01:49.200 --> 02:16.575
[SPEAKER_00]: 这说明当前很多模型能力的侧量其实亮的是模型在某个特定约树下的表现而不是模型真正的上线平测框架本身是有偏差的对API用户来说今天的实际影响是GPT5.6Luna和Tera的定价下条作在速度上有提升如果你是在用OpenAIAPI跑P量任务或者原型开发现在重新算一次成本仗是值得的

02:16.935 --> 02:37.572
[SPEAKER_00]: 这里有一个更大的背景值的关注当模型开始帮助优化自己的推理效率AI开发的编辑成本曲线就开始完全了这不是什么遥远的AGI许识是正在发生的商业模式变化经济模型帮自己降价这不是比喻这是这个基督的财报主角

02:37.952 --> 02:58.017
[SPEAKER_00]: 行动清单,你可以今天去OpenAI的开发者文当你确认,你再用的模型版本看看是否已经可以切换到GPD5.6系列重新算一下调用成本,这是在推理密集型任务里,显示保留对话上下文而不是每次都全心请求,看看结果质量是否有变化

02:58.317 --> 03:15.782
[SPEAKER_00]: 你可以留意ARC,AGI,三,排行榜这个基準正在成为很良模型真实推灵能力的重要参考值得每个一段时间看一次Google一个月修了过去两年的漏洞数量AI在安全领域开始规模化

03:16.485 --> 03:32.404
[SPEAKER_00]: 这篇来自GoogleSecurityblog原文标题是StrongerwithEveryUpdatehowwe'remakingchromeandthewebsaferintheAIera有hackernews社去推送你可能以为AI用于安全领域主要时邦黑客写攻击交本

03:33.085 --> 03:55.149
[SPEAKER_00]: Google这篇文章给出了一个反方向的数据点而且数字相当刺激20026年6月Chrome安全团队用AI服处发现和修复的漏洞数量超过了过去两年的总合这件事重点不在于速度而在于AI在做一种此前只有几少数顶级安全专家才能做的事

03:55.929 --> 04:16.458
[SPEAKER_00]: 系統性的大規模的掃描貸馬庫找那些藏在深處的內存安全漏洞傳統的安全神經是什麼樣的你故意批人他們帶著專業知識一段一段的獨貸馬找那些微妙的錯誤這個過程慢貴而且獸製專家數量AI做的是是把這個過程工業化

04:17.038 --> 04:43.260
[SPEAKER_00]: Google的做法是把LLM部署在貸馬審查流程裡讓它做漏洞發現分類優先級以及生成不定草案人類工程師負責最終驗證這是一個人機協作的質量提升不是提的但這裡有一個Hackenuse社區正在討論的真實爭議如果AI能這麼快找到漏洞那用同樣的AI去找還沒被修復的漏洞

04:44.505 --> 05:11.264
[SPEAKER_00]: 会不会让攻击方的速度也成倍提升这个问题没有简单单防守方用AI是存量游戏攻击方用AI是增量游戏两边的速度差才是关键变量对设计师和产品人来说这件事有一个值得签议的框架AI不只是生产内容它也可以做系统省计如果你再做UX省计可访问性检查设计一致性掃描同样的思路可以被接用

05:11.984 --> 05:38.304
[SPEAKER_00]: 经济,AI真正改变安全领域的地方,是重写了工房两边各自的规模上线行动清单,你可以把AI扶住神记的思路,引入你的设计流程,让AI过一遍你的组监库和文章,找悲质的地方事实用Clod或GPT对你的代码做一次安全角度的读取提示此理明确说要找潜在漏洞,看它能发现什么?

05:38.444 --> 06:06.499
[SPEAKER_00]: 你可以关注HackerNews上关于AI安全工房的讨论这个话题在未来半年会变得越来越重要DipSickV4Flash开拳中了开原阵营的节奏在加快这篇来自SimonWilson的播客他在追踪HuggingFace上新发布的DipSickV4Flash0731很多人的印象是DipSick是那个便宜的中国模型这个印象低估了他正在做的事

06:07.860 --> 06:29.063
[SPEAKER_00]: DipSickV4Flash今天上傳到了HaggingFace開放全種這意味著任何人可以下載運行微調他放在6個月前這個級別的模型能力必緣實驗是會把它當成核心資產所起來現在DipSick直接把它放出來了

06:29.744 --> 06:56.125
[SPEAKER_00]: 開權重這件事為什麼重要?拿出來打筆訪必緣模型像是一本你只能在突出管理讀的書不能畫線,不能帶回家開權重模型是你可以拿到手裡改寫甚至印一百本的那種你可以把它部署在本地,不用付API費用也不用擔心數據離開你的環境對小團隊和個人創作者來說這是真實的成本結構變化

06:56.665 --> 07:22.623
[SPEAKER_00]: 你在Anthropic或OpenAI的API上跑一個智能體每個月的費用可能是幾百到幾千美元在本地跑一個開權重模型硬件折就之外幾乎沒有變動成本3.Walesen的角度值得借用它真正關注的是模型在實際工具調用和代碼任務裡的行為是否可預測記者分數反而排在後面

07:23.924 --> 07:51.019
[SPEAKER_00]: 這是從工程師事者做模型選型時最核心的問題,能力第二,可控興地當前開完正義的節奏讓必緣實驗時為持定家優勢的窗口變窄了BandedictEvans最近寫過一篇關於偷刊定價的文章他的核心論點是,現在是供應景缺期,但一旦開權重模型追上來,價格會被打穿DeepSeek今天的動作就是在硬正這個方向

07:51.519 --> 08:06.685
[SPEAKER_00]: 经济开权重模型不是免费的模型是你真正拥有的模型行动清单你可以去哈丽非上看DeepSeekV4Flash0731的模型卡了解它的参数规模和任务室配范围

08:07.545 --> 08:30.745
[SPEAKER_00]: 事實用RM或LMStudio在本地跑一個DPC系列的模型感受一下本地推理的延遲和能力差距你可以做一個簡單的成本對比你現在每月API支出和購置和租用本地推理應見的攤銷成本哪個更合算AI美學正在形成設計員被截持了觀點片

08:31.505 --> 08:52.160
[SPEAKER_00]: 这篇来自君牛神的个人播客Block点君不够牛神点抗原本标题是DAI-STATIC这是今天的观点篇你有没有注意到所有AI产品都开始长得像同一个东西见面色的背景模糊的光月还有那个无处不在的符号

08:52.880 --> 09:15.542
[SPEAKER_00]: GimNusen的这篇文章做了一件很有趣的事他把现在的AI设计语言放进了历史上每次新技术浪潮都会带来的设计符号演辩里去看他觉得例子是汉宝财丹也就是那三条橫线的图标他在移动端绝起的时候出现是因为屏幕太小需要一种方式把导航藏起来

09:15.982 --> 09:31.164
[SPEAKER_00]: 解决了一个真实的约书问题然后慢慢被所有人接受现在在桌面端也到处都是变成了菜单这个概念的视觉符号然后它问了一个问题AI正在形成什么样的设计语言这个符号现在代表的是什么

09:31.845 --> 09:57.499
[SPEAKER_00]: 在AI之前閃閃發光的新型是魔法社華傑清AI出現之後他變成了這裡有AI這個傑持是硬性的用戶甚至沒有主動同意過這對設計式的工作有直接影響當你用某個視覺符號來表達AI在這裡工作你其實是在引導用戶建立一種期待如果那個期待和實際體驗有落差就從信任符號變成了諷刺符號

09:57.839 --> 10:20.097
[SPEAKER_00]: 更生意层紐索擔心的是这波AI设计语言是功能驱动的还是情绪驱动的漢堡菜单解决了一个真实约束解决了什么约束它的答案是它解决的是焦率是公司需要像用户快速传达我们有AI的焦率这是营销罗记不是设计罗记

10:20.697 --> 10:41.548
[SPEAKER_00]: 经济,在AI之前代表魔法,在AI之后代表营销,这两件事不总是同一件事,行动清单,你可以省试一下你自己的产品或设计理,用来表达AI功能的视觉元素,他们是在解决用户的认知问题,还是在解决公司的传播交律。

10:41.808 --> 11:00.607
[SPEAKER_00]: 試試不用任何AI圖標或見面重新設計一個AI功能的入考看看唇靠交互邏輯能不能傳達同樣的信任感你可以把GimNusen的這篇文章分享給你的團隊討論你們產品的AI設計與研視科有意識的建立還是更封形成的

11:01.147 --> 11:28.519
[SPEAKER_00]: MirrorCodeAI能獨立完成多大的編成項目社區片這篇來自InportAI第四百六十六七JackClark介紹了一袍KAI和Meter聯合發布的MirrorCode基準測試HackerNews社區也在同步討論這件事通常我們測試AI的代碼能力事讓它修一個bug或者實現一個寒數MirrorCode的問題是一個更野心薄薄的問題

11:29.059 --> 11:57.198
[SPEAKER_00]: AI能不能在完全不看原始代码的情况下把一个完整的软件项目重新写出来这个测试的设计逻辑很精妙它选了25个现实中存在的程序包括Unix工具数据处理交本各类应用AI看不到原代码只知道这个程序应该做什么然后它要从零开始写最后用一套测试来验证包括那些AI没有见过的隐藏测试结果是什么?

11:58.239 --> 12:14.855
[SPEAKER_00]: 現階段的頂尖模型能完成其中一部分但最難的任務還搞不定JackClock的評論是AI系統還無法解決最難的任務這是好事為什麼是好事因為這意味著評測還有意義還沒有被保和

12:15.495 --> 12:30.045
[SPEAKER_00]: 一旦所有模型都满分了我们就失去了一把尺子对产品人和设计事来说Miracle的提出的这个饭事值得借用他测得核心问题是能做多大而不是单纯的能不能

12:30.685 --> 12:55.891
[SPEAKER_00]: 這是一個關於AI自主工作範圍的問題和我們在部署智能體驗是真正需要問的問題是一樣的我可以給它多長的任務鏈它會在哪裡掉鏈子還看用斯的討論裡有一個有意思的分歧有人認為這種基準太學術真實工程任務比這複雜的多也有人說能獨立重寫一個UNEX工具已經比大多數初級工程是強了

12:56.771 --> 13:12.831
[SPEAKER_00]: 这个争议没有标准答但他只项了一个我们都需要自己做判断的问题现在的AI边程能力到底处于什么位置经济能修一个Bug很能重写一个完整程序是两个亮机的能力Miracle在测的是后者

13:13.572 --> 13:39.923
[SPEAKER_00]: 行動清單,你可以去一袍可點,AI寫稿Miracle的看一下這個基準的詳細設計了解它選了那些程序類型以及測試的通過標準是什麼這是用你最常用的模型給它一個你熟悉的小工具的需求說明讓它從靈開始實現然後自己評估結果的質量和你的預期差多少你可以把任務鏈長度做一個評估圍度

13:40.523 --> 14:01.864
[SPEAKER_00]: 下次使用AI智能体识有意识的推测它会在哪个步骤开始出错就会帮你更准确的设计人工节点今天5件事从降价的模型到修漏动的AI再到被节契的设计语言共同指向一件事AI的影响已经深入到我们平时不太注意的地方了

14:02.786 --> 14:20.218
[SPEAKER_00]: 今天提到的所有圆文鏈接都在節目的收納此理保持好奇我們明天繼續感謝您的收聽有任何建議意見請在X也就是推特上與Bear6聯繫本節目還會繼續進化請保持期待我們明天再見

